Релизы, заметки об исследованиях и наши выступления вживую
Три специализированные модели видеогенерации для Physical AI доменов: для автономного транспорта, робототехники и сложной физики. За основу взята модель Kandinsky 5.0 Video Lite (2 млрд параметров) и дообучена на данных из соответствующих доменов. Поверх доменно адаптированных моделей применены Post‑Train трюки RL и SOAR. По внутренней валидации Kandinsky WM 1.0 занимает топ‑4 PAI‑Bench‑G, топ‑5 на Physics‑IQ Verified и топ‑6 RBench. Открытый код под лицензией MIT.
Читать →Наша исследовательская команда выступила на Международной конференции по машинному обучению в COEX, Сеул — представила постеры и доклады о последних разработках лаборатории в генеративном моделировании.
Аудиотокенайзер на 48 кГц на модифицированной архитектуре DAC с непрерывным латентным представлением — Snake‑активации, 64 латентных канала, self-attention в бутылочном горлышке. Превосходит MMAudio, MovieGen и SAME-L по качеству text‑to‑audio. Код и веса под лицензией MIT.
Читать →Новый флагман на смену Kandinsky 5.0 работает до двух раз быстрее, лучше понимает сложные запросы и создаёт более детализированные изображения. Новая архитектура Mixture‑of‑Experts и Image RAG приносят бесплатное профессиональное редактирование без ограничений на генерацию.
Читать →Наша статья принята на DeLTa Workshop on Deep Generative Models. В ней предложен подход Bridge Matching для временно‑коррелированных данных, таких как видео, превосходящий базовые методы в интерполяции кадров, image‑to‑video и суперразрешении видео.
Две новые модели со сжатием 4×8×8 и 4×16×16, GroupNorm заменён на покадровый RMSNorm с перебалансировкой ёмкости энкодера и декодера. Превосходит Wan 2.2 и HunyuanVideo 1.5 по объективным метрикам; код и веса открыты на GitHub.
Читать →«Краткая история визуального генеративного ИИ: модели Kandinsky» — от Малевича и Kandinsky 1.0 в 2022 году до семейства Kandinsky 5.0, признанного лидером среди открытых моделей на lmarena.
Команда присоединилась к 40‑й конференции AAAI по искусственному интеллекту в Singapore EXPO, чтобы пообщаться с исследовательским сообществом и быть в курсе последних новостей генеративного ИИ.
Полное семейство Kandinsky 5.0: Image Lite (6B) для HD‑генерации и редактирования, Video Pro (19B) для видео длительностью до 10 секунд. Video Pro сопоставим с Veo 3 от Google по визуальному качеству и динамике движения. Нативная поддержка запросов на английском и русском.
Читать →Публичный доступ через ботов GigaChat и Kandinsky в Telegram — 10 бесплатных генераций, затем 10 в день после входа, плюс реферальный бонус. Текст‑в‑видео, изображение‑в‑видео, движения камеры и сопряжение с другими генеративными инструментами Kandinsky Lab.
Читать →Обучена на 10М+ изображениях текста на русском языке, нанесённого на реальные материалы — резьба по дереву, литьё металла, вышивка, лепестки роз, — Kandinsky Image теперь органично вплетает кириллические надписи в сцену, а не просто накладывает их сверху.
Читать →Открытая видеомодель на 2 млрд параметров, не уступающая гораздо более крупным конкурентам. Diffusion transformer с cross-attention, разреженным NABLA sparse attention, обучена на 124M видеосценах и 520M изображениях — модель, открывшая эпоху Kandinsky 5.0.
Читать →