Линейка лёгких (2B параметров) высокоскоростных моделей для генерации видео из текста и изображения — ролики до 10 секунд в разрешении до 768×512 — топ‑5 среди открытых моделей на Text‑to‑Video Arena
- SFT‑модели — наивысшее качество генерации после дообучения на курируемых видео и изображениях
- No CFG дистиллированные модели — в 2 раза быстрее за счёт удаления classifier‑free guidance
- Дистиллированные 16‑шаговые модели (Flash) — ускорение в 6 раз через Trajectory Segmented Consistency Distillation
- Претрейн‑чекпоинты — для дальнейшего дообучения и исследований
текст‑в‑видео изображение‑в‑видео ≤10 с 768×512 24 fps
Рейтинг на Arena Линейка мощных (19B параметров) моделей для генерации видео из текста и изображения — ролики до 10 секунд в высоком разрешении. Обеспечивает лучшую в своём классе визуальную точность, кинематографичную динамику движения и точное следование запросу — №1 место среди открытых моделей на Text‑to‑Video Arena
- SFT‑модели — наивысшее качество генерации после дообучения на курируемых видео и изображениях
- Дистиллированные 16‑шаговые модели (Flash) — ускорение в 6 раз через Trajectory Segmented Consistency Distillation
- Претрейн‑чекпоинты — для дальнейшего дообучения и исследований
текст‑в‑видео изображение‑в‑видео ≤10 с 24 fps 1280×768
Рейтинг на Arena