Как сделать говорящий аватар

Коротко. Нужны портрет и звуковая дорожка. Hedra строит движение губ по звуку, добавляет моргание и повороты головы. Ролик на 8 секунд на Character-3 стоит 48 кредитов, генерация занимает от двух до десяти минут. Бесплатных 300 кредитов хватает на шесть таких роликов.

Hedra — персонаж анфас: ракурс, который лучше всего подходит для говорящего аватара
Персонаж
Анфас, лицо крупным планом, спокойное выражение

С такого кадра ролик собирается чище всего: профиль и мелкая голова в кадре дают размытую мимику. Что ещё важно в исходнике — в списке ниже.

Требования к фотографии

Качество исходника определяет результат сильнее, чем выбор модели. Hedra принимает PNG, JPEG и WebP, и чем больше исходное разрешение, тем меньше артефактов на лице.

  • Ракурс. Анфас или три четверти. Профиль модели отрабатывают плохо: обучающие данные почти целиком состоят из фронтальных кадров.
  • Выражение. Спокойное лицо, рот закрыт или чуть приоткрыт. Широкая улыбка на исходнике мешает — губы стартуют из неудобного положения.
  • Свет. Ровный, без жёстких теней на половине лица и без контрового источника за спиной.
  • Кадрирование. Лицо занимает заметную часть кадра. Портрет в полный рост с маленькой головой даёт размытую мимику.

Своего снимка может не быть вовсе — персонажа генерируют прямо в студии. Для повторяемого героя бренда подходит Nano Banana Pro: он держит внешность между генерациями, поэтому один и тот же ведущий появляется в разных роликах без расхождений.

Требования к звуку

Липсинк строится по звуковой дорожке, значит грязная запись портит результат так же, как плохое фото. Работают три пути: загрузить свой файл, наговорить текст в браузере или синтезировать голос из библиотеки платформы — там больше 4 000 голосов, синтез стоит 15 кредитов за тысячу знаков.

  • Чистая речь без фонового шума и эха.
  • Ровный темп: скороговорка и крик снижают точность попадания в фонемы.
  • Чёткая артикуляция, без тяжёлых эффектов и сильной компрессии.
  • Для мультиязычной серии — сначала перевод и озвучка, затем перегенерация ролика: движение губ пересчитывается под новую дорожку.

Порядок действий

Заведите аккаунт и получите кредиты

Регистрация проходит по почте и без карты, на баланс сразу падает 300 кредитов. Из России студия открывается без VPN — ограничение касается только оплаты подписки.

Загрузите портрет

Или сгенерируйте персонажа в студии. Готовый образ имеет смысл сохранить как элемент — тогда он подставится в следующие ролики без повторной загрузки.

Подготовьте дорожку

Загрузите запись или соберите озвучку в студии. Текст на две минуты начитки укладывается примерно в 1 800 знаков и обходится в 27 кредитов — на фоне стоимости видео это мелочь.

Выберите модель и запустите

Character-3 для короткого клипа, Omnia для длинной сцены с выразительной мимикой. Кредиты списываются в момент запуска, поэтому первый прогон разумно делать в самом дешёвом варианте.

Соберите длинный ролик

Клип большинства моделей ограничен 8 секундами. Минутное видео складывается из нескольких сцен в редакторе платформы, там же подставляется музыка и делаются переходы.

Выгрузите результат

Перед экспортом клип можно поднять апскейлом до 4K. На бесплатном тарифе на видео остаётся водяной знак, коммерческое использование открывается с Basic за 15 $ в месяц.

Сколько это стоит

Считаем на Character-3 при 6 кредитах за секунду. Клип на 8 секунд — 48 кредитов, минутный ролик из восьми таких клипов — 384 кредита плюс 27 на синтез речи.

Задача Расход в кр. На Creator
Клип 8 секунд 48 112 клипов
Ролик на 32 секунды из 4 клипов 192 28 роликов
Ролик на минуту из 8 клипов с озвучкой 411 13 роликов
Проверка кадра на дешёвой модели 32 168 проверок

В расчёте минутного ролика учтены 8 клипов по 8 секунд (384 кредита) и 1 800 знаков синтезированной речи (27 кредитов). Проверка кадра считается на MiniMax Hailuo 2.3 Fast Standard по 4 кредита за секунду.

Что чаще всего идёт не так

Персонаж говорит, но голова стоит колом

Так выглядит результат, когда исходник снят строго фронтально при равномерном свете и без единой асимметрии. Помогают лёгкий поворот на исходном кадре и прямое указание движения в описании сцены. Модели Kling и Omnia отрабатывают динамику иначе, чем Character-3, — смена модели иногда решает вопрос быстрее правки промпта.

Губы дрожат и промахиваются по словам

Причина почти всегда в звуке: фоновый шум, сильная компрессия, слишком быстрая речь. Перезапись с чистой дорожкой исправляет ситуацию надёжнее, чем перегенерация с тем же файлом. Если своей записи нет, синтез в студии даёт заведомо подготовленный под конвейер звук.

Кредиты закончились на третьем дубле

Списание идёт при запуске генерации, поэтому неудачный дубль оплачивается наравне с удачным. Рабочая привычка — проверять композицию и ракурс на дешёвой модели, а на Omnia или Veo переходить, когда сцена уже утверждена.

Ролик получился короче, чем нужно

Ограничение в 8 секунд относится к одной генерации, а не к итоговому ролику. Длинное видео собирается из нескольких клипов; чтобы персонаж не менялся между сценами, его сохраняют как элемент и подставляют в каждую генерацию.

Оживите свой портрет

Портрет, текст и пара минут ожидания — этого достаточно, чтобы получить говорящего персонажа.