Шоурил
ТОП

Мы — №1 среди open-source решений на Text‑to‑Video Arena

Смотреть рейтинг
Текущая · Семейство 5.0 #1 open-source lab · Text‑to‑Video Arena

Kandinsky Video 5.0

Генерация видео из текста и изображения в двух размерах — лёгкая модель для скорости и полноразмерная модель, занимающая №1 место среди открытых моделей на Text‑to‑Video Arena. Обе обучены для нативного понимания русского языка и культурных концептов

Video Lite

Быстрая

Линейка лёгких (2B параметров) высокоскоростных моделей для генерации видео из текста и изображения — ролики до 10 секунд в разрешении до 768×512 — топ‑5 среди открытых моделей на Text‑to‑Video Arena

  • SFT‑модели — наивысшее качество генерации после дообучения на курируемых видео и изображениях
  • No CFG дистиллированные модели — в 2 раза быстрее за счёт удаления classifier‑free guidance
  • Дистиллированные 16‑шаговые модели (Flash) — ускорение в 6 раз через Trajectory Segmented Consistency Distillation
  • Претрейн‑чекпоинты — для дальнейшего дообучения и исследований
текст‑в‑видео изображение‑в‑видео ≤10 с 768×512 24 fps
Рейтинг на Arena

Video Pro

Умная

Линейка мощных (19B параметров) моделей для генерации видео из текста и изображения — ролики до 10 секунд в высоком разрешении. Обеспечивает лучшую в своём классе визуальную точность, кинематографичную динамику движения и точное следование запросу — №1 место среди открытых моделей на Text‑to‑Video Arena

  • SFT‑модели — наивысшее качество генерации после дообучения на курируемых видео и изображениях
  • Дистиллированные 16‑шаговые модели (Flash) — ускорение в 6 раз через Trajectory Segmented Consistency Distillation
  • Претрейн‑чекпоинты — для дальнейшего дообучения и исследований
текст‑в‑видео изображение‑в‑видео ≤10 с 24 fps 1280×768
Рейтинг на Arena
Сгенерировано в Kandinsky Video 5.0

Предыдущие версии

Май 2024

Kandinsky Video 1.1

17.5B параметров — генерация 5.5‑секундных видео, обучена на 4.6M пар текст‑видео с описаниями от LLaVA-1.5

Ноя 2023

Kandinsky Video 1.0

17.5B параметров — генерация 8‑секундных видео из текста. Интерполяция ключевых кадров в разрешении 512×512