Требования к фотографии
Качество исходника определяет результат сильнее, чем выбор модели. Hedra принимает PNG, JPEG и WebP, и чем больше исходное разрешение, тем меньше артефактов на лице.
- Ракурс. Анфас или три четверти. Профиль модели отрабатывают плохо: обучающие данные почти целиком состоят из фронтальных кадров.
- Выражение. Спокойное лицо, рот закрыт или чуть приоткрыт. Широкая улыбка на исходнике мешает — губы стартуют из неудобного положения.
- Свет. Ровный, без жёстких теней на половине лица и без контрового источника за спиной.
- Кадрирование. Лицо занимает заметную часть кадра. Портрет в полный рост с маленькой головой даёт размытую мимику.
Своего снимка может не быть вовсе — персонажа генерируют прямо в студии. Для повторяемого героя бренда подходит Nano Banana Pro: он держит внешность между генерациями, поэтому один и тот же ведущий появляется в разных роликах без расхождений.
Требования к звуку
Липсинк строится по звуковой дорожке, значит грязная запись портит результат так же, как плохое фото. Работают три пути: загрузить свой файл, наговорить текст в браузере или синтезировать голос из библиотеки платформы — там больше 4 000 голосов, синтез стоит 15 кредитов за тысячу знаков.
- Чистая речь без фонового шума и эха.
- Ровный темп: скороговорка и крик снижают точность попадания в фонемы.
- Чёткая артикуляция, без тяжёлых эффектов и сильной компрессии.
- Для мультиязычной серии — сначала перевод и озвучка, затем перегенерация ролика: движение губ пересчитывается под новую дорожку.