Маршрут виробництва 24 файлів + SRT із 6 сценаріїв

6 AI talking-head роликів: де саме такі проєкти ламаються і як я це закриваю

У вашому ТЗ уже є все, чого зазвичай бракує: два презентери, готові сценарії, хронометраж по секундах, технічні параметри, обмеження і порядок приймання. Тому нижче — не переказ вашого ТЗ, а те, чого в ньому за визначенням немає: виробничий маршрут і перелік місць, де AI-ролики з говорящою головою провалюються — з тим, що я роблю в кожному з них.

1. Що насправді означає «24 файли»

6 майстрів по 40–45 с, з кожного 15-секундна версія, кожне у 16:9 і 9:16, плюс .srt до кожного. Це не «6 роликів і трохи монтажу» — це шість незалежних виробничих ланцюжків, де помилка на першому кроці множиться на чотири на виході. Звідси єдине правило, за яким я будую роботу:

Голос і аватар генеруються один раз на сценарій, у найвищій якості й у 16:9. Далі 15-секундна версія монтується з того самого матеріалу, а 9:16 — це перекадрування з окремою версткою плашок, а не обрізка. Якщо робити навпаки (генерувати кожен формат окремо), два формати одного ролика будуть різними дублями: інша інтонація, інший блимок ока, інший темп — і глядач, який побачить обидва, помітить це швидше за вас.

2. Маршрут одного майстра, крок за кроком

Крок 1. Голос — раніше за аватар

Спершу озвучка: австралійський акцент, темп під 40–45 с, наголоси в потрібних місцях. Причина порядку проста — саме голос задає довжину і ритм ролика. Якщо спочатку згенерувати аватар, а потім підганяти під нього голос, виходить або квапливе читання, або пауза в кінці.

Тут же вирішується найчастіша проблема з акцентом: цифри й дати. «31 October», «25, 50, even 75 percent», «15-minute» — це місця, де синтез найчастіше збивається на американську вимову або на неприродний наголос. Їх я слухаю окремо ще до генерації відео.

Крок 2. Аватар під готову доріжку

Презентер A і презентер B — різні обличчя, різні голоси, різні фони, як у ТЗ. Перевіряю три речі, які й відрізняють «живого» аватара від застиглого: мікрорухи голови не зациклені на короткому відрізку; моргання нерівномірне; жести рук є хоча б у частині кадрів і не повторюються один в один між роликами того самого презентера.

Крок 3. Липсинк — покадрова перевірка, а не «на слух»

Липсинк розходиться не рівномірно, а на швидких приголосних і на початку фрази після паузи. Перевіряю по кадрах у місцях стиків, а не прослуховуванням цілого ролика: на швидкості відтворення 0,5× видно те, чого не чути на 1×.

Крок 4. Плашки і вставки

Вставки у вас описані всередині сценаріїв — календар із 31 October, екран біржі, конверт, графік, галочка. Роблю їх так, щоб вони не «затуляли» обличчя: вставка на 2–3 с, обличчя повертається до того, як глядач встигне вийти з ролика. Ключові слова в плашках виділяються кольором — той самий колір по всіх шести роликах, інакше пакет розсипається візуально.

Крок 5. Два формати

16:9 — 1920×1080. 9:16 — 1080×1920 перекадруванням: обличчя в безпечній зоні, очі у верхній третині, плашки переверстані під вузький кадр, а не масштабовані. У вертикалі окремо перевіряю, що нижні 15% не перекриті інтерфейсом майданчика.

Крок 6. Субтитри

Вшиті в кадр + окремий .srt англійською. .srt робиться з фактичної доріжки й звіряється з нею за таймкодом — не з початкового тексту сценарію: після заміни фрази на озвучці текст і субтитр розходяться саме тут.

3. Перші 3 секунди — окремо

У вашому ТЗ це вимога в один рядок, але саме вона вирішує вартість показу. Що я перевіряю у кожному з шести хуків:

СценарійЩо тримає перші 3 сРизик
A1 — дедлайнпряме питання + дата на календарінизький
A2 — дані з біржтвердження «вони вже мають ваші дані»низький
A3 — три помилкилічильник «1 / 2 / 3» — тримає до кінцянизький
B4 — SMSFвужча аудиторія, хук працює тільки на «своїх»середній
B5 — пряме питанняпитання в лоб + плашканизький
B6 — історія клієнтарозповідь; перші 3 с найслабші з шестисередній
По двох роликах із позначкою «середній» я б запропонував зняти по другому варіанту хука (ті самі 3 секунди, інше перше речення) — це дешево на етапі озвучки й дає вам A/B прямо в кабінеті. Пропозиція, не наполягання: сценарії ваші.

4. Обмеження з вашого ТЗ — як вони стають чек-листом

Заборони в такому проєкті — не формальність: одна з них здатна зупинити модерацію всього кабінету. Тому вони в мене не «пам'ятаю», а пункт приймання по кожному файлу:

ОбмеженняДе перевіряється
Жодних обіцянок результату, «guarantee», конкретних сум економіїтекст сценарію + текст плашок + субтитри (три різні місця, де слово може просочитися)
Презентер не називає себе бухгалтером чи співробітником практикиозвучка + плашки
Без державної символіки, без реальних листів податковоїкожна вставка окремо
Без назв бірж великим планомвставка «екран біржі» — розмиття перевіряється покадрово
Без чужих логотипів на одязі й фонігенерація аватара, до монтажу
Без чужих відгуків і облич реальних людейвибір аватара
Без водяних знаків платформи генераціївихідний рендер

5. Технічна здача

відео    MP4 / H.264 / 25 або 30 fps / ≥ 8 Mbps
         16:9 — 1920×1080 · 9:16 — 1080×1920 (перекадрування)
звук     AAC 48 kHz stereo, приблизно −14 LUFS
         музика тихіше голосу ≈ на 18 dB, голос розбірливий усюди
субтитри вшиті в кадр + окремий .srt (англ.), звірені з доріжкою
імена    A1_deadline_16x9.mp4 · A1_deadline_9x16.mp4
         A1_deadline_15s_16x9.mp4 · A1_deadline_15s_9x16.mp4 ...
вихідні  тексти сценаріїв · ID аватара і голосу · аудіодоріжки
         · використані вставки й плашки · проєкт монтажу
Гучність −14 LUFS і музика −18 dB — це те, що я міряю приладом на кожному файлі, а не «ставлю на слух». Різнобій гучності між шістьма роликами в одному кабінеті видно одразу і він б'є саме по досмотрам.

6. Порядок, у якому я пропоную йти

Етап 1
Тестовий ролик: презентер A, сценарій 1, обидві версії, обидва формати + SRT. Плюс — окремо голосова доріжка на погодження ще до відео, щоб акцент і темп ви почули раніше, ніж витрачено генерацію.
Етап 2
Приймання тесту, один круг правок. Тут фіксуються: голос, фон, шрифт плашок, колір виділення — далі вони не змінюються, і решта роликів стає передбачуваною.
Етап 3
Решта 5 майстрів із їхніми 15-секундними версіями й форматами.
Етап 4
До 2 кругів правок на ролик. Правка — заміна фрази, плашки, вставки, темпу.
Далі
Re-skin: той самий сценарій і монтаж, інший аватар і голос. Робиться швидко саме тому, що монтаж і плашки вже зібрані.

7. Чого я не обіцяю

Не обіцяю, що аватар буде невідрізненний від живої зйомки. На 40 секундах великим планом уважний глядач сучасний AI-аватар упізнає — питання лише в тому, заважає це офферу чи ні. Обіцяю інше: жодного «застиглого» кадру, жодного зацикленого руху і точний липсинк на всіх стиках.

Не обіцяю показників реклами. Ролик відповідає за хук, розбірливість, темп і відповідність обмеженням — за CPM і конверсію відповідає кабінет і оффер.

Це виробничий маршрут під ваше ТЗ, а не готовий ролик. Найкоротший шлях перевірити мене — етап 1 із вашого ж порядку роботи: тестовий ролик за сценарієм 1, з голосовою доріжкою на погодження до початку генерації відео.