KVAE 2.0 Image
KVAE 2.0 Image — непрерывный токенизатор изображений для диффузионных text-to-image моделей. Модель использует пространственное сжатие 8×8, 32 латентных канала и содержит около 0,2 млрд параметров. В наших тестах реконструкции KVAE 2.0 Image превосходит VAE ведущих открытых text-to-image моделей по метрикам PSNR и SSIM. Качество латентного пространства также переносится на последующую генерацию: в фиксированной конфигурации text-to-image генератора KVAE 2.0 Image чаще предпочитают по итогам субъективной side-by-side оценки с учётом следования промпту, визуального качества и семантической согласованности.