Что делает Omnia особенной
Обычная схема генерации разделяет задачи: сначала модель предсказывает движение губ, затем накладывает его на картинку. Omnia работает иначе — она разбирает изображение, текст и звук одновременно. Практический эффект в том, что интонация и жест совпадают: на ударном слове персонаж не просто открывает рот шире, а меняет положение головы и выражение глаз. Omnia же держит более длинную сцену, чем остальные модели каталога.
Character-3 решает ту же задачу дешевле и проще. Её область — короткий клип с говорящим лицом, где не нужна выразительная актёрская игра: озвучка новости, карточка товара, шапка рассылки. Секунда стоит 6 кредитов, и это делает Character-3 удобным инструментом для черновиков.
Обе модели используют один и тот же принцип: ведущий — звук. Поэтому русская озвучка синхронизируется наравне с английской, а язык дорожки на качество липсинка не влияет. Интерфейс студии при этом остаётся англоязычным.