K-VAE

KVAE — семейство открытых вариационных автоэнкодеров для генерации аудио, изображений и видео. Модели преобразуют высокоразмерные сигналы в компактные непрерывные латентные представления, сохраняющие важные детали и предназначенные для последующих диффузионных моделей. В наших оценках KVAE‑Audio и KVAE‑Video входят в число наиболее сильных открытых токенизаторов, сочетая качественную реконструкцию с более высоким качеством генерации по сравнению с протестированными аналогами.

Текущие модели

KVAE 2.0 Image

0,2 млрд

KVAE 2.0 Image — непрерывный токенизатор изображений для диффузионных text-to-image моделей. Модель использует пространственное сжатие 8×8, 32 латентных канала и содержит около 0,2 млрд параметров. В наших тестах реконструкции KVAE 2.0 Image превосходит VAE ведущих открытых text-to-image моделей по метрикам PSNR и SSIM. Качество латентного пространства также переносится на последующую генерацию: в фиксированной конфигурации text-to-image генератора KVAE 2.0 Image чаще предпочитают по итогам субъективной side-by-side оценки с учётом следования промпту, визуального качества и семантической согласованности.

непрерывный латент 8×8 пространственно 32 канала

KVAE 1.0 Audio

48 кГц

KVAE 1.0 Audio — непрерывный полнодиапазонный аудиотокенизатор с частотой дискретизации 48 кГц, входящий в число наиболее сильных открытых аудиотокенизаторов. Он сжимает исходные аудиосигналы в компактные непрерывные латенты и с высокой точностью реконструирует речь, музыку и другие звуки. KVAE 1.0 Audio создан не только для качественной реконструкции сигнала: его латентное пространство хорошо подходит для обучения диффузионных моделей. При использовании его в качестве токенизатора в фиксированном text-to-audio генераторе улучшается качество генерации, модель превосходит открытые альтернативы в side-by-side оценках.

непрерывный латент полный диапазон
48 кГц

KVAE 2.0 Video

Каузальная

KVAE 2.0 Video — семейство каузальных видеотокенизаторов для диффузионных генеративных моделей. В наших reconstruction-тестах и сравнении side-by-side выпущенные модели превосходят сравниваемые открытые токенизаторы по ключевым показателям качества реконструкции и генерации. Обе версии используют временное сжатие 4× и пространственное сжатие 8×8 или 16×16. Полностью свёрточная архитектура и кэширование временного контекста позволяют эффективно обрабатывать длинные видео по частям.

4× по времени только свёртки
8×8 / 16×16 пространственно

Предыдущие версии

Март 2026

KVAE‑2D‑1.0

Токенизатор изображений первого поколения K‑VAE, работает в паре с KVAE‑3D‑1.0

Март 2026

KVAE‑3D‑1.0

Токенизатор видео первого поколения K‑VAE, заменён на KVAE‑Video 2.0