У вашому ТЗ уже є все, чого зазвичай бракує: два презентери, готові сценарії, хронометраж по секундах, технічні параметри, обмеження і порядок приймання. Тому нижче — не переказ вашого ТЗ, а те, чого в ньому за визначенням немає: виробничий маршрут і перелік місць, де AI-ролики з говорящою головою провалюються — з тим, що я роблю в кожному з них.
6 майстрів по 40–45 с, з кожного 15-секундна версія, кожне у 16:9 і 9:16, плюс
.srt до кожного. Це не «6 роликів і трохи монтажу» — це шість
незалежних виробничих ланцюжків, де помилка на першому кроці множиться на чотири
на виході. Звідси єдине правило, за яким я будую роботу:
Спершу озвучка: австралійський акцент, темп під 40–45 с, наголоси в потрібних місцях. Причина порядку проста — саме голос задає довжину і ритм ролика. Якщо спочатку згенерувати аватар, а потім підганяти під нього голос, виходить або квапливе читання, або пауза в кінці.
Тут же вирішується найчастіша проблема з акцентом: цифри й дати. «31 October», «25, 50, even 75 percent», «15-minute» — це місця, де синтез найчастіше збивається на американську вимову або на неприродний наголос. Їх я слухаю окремо ще до генерації відео.
Презентер A і презентер B — різні обличчя, різні голоси, різні фони, як у ТЗ. Перевіряю три речі, які й відрізняють «живого» аватара від застиглого: мікрорухи голови не зациклені на короткому відрізку; моргання нерівномірне; жести рук є хоча б у частині кадрів і не повторюються один в один між роликами того самого презентера.
Липсинк розходиться не рівномірно, а на швидких приголосних і на початку фрази після паузи. Перевіряю по кадрах у місцях стиків, а не прослуховуванням цілого ролика: на швидкості відтворення 0,5× видно те, чого не чути на 1×.
Вставки у вас описані всередині сценаріїв — календар із 31 October, екран біржі, конверт, графік, галочка. Роблю їх так, щоб вони не «затуляли» обличчя: вставка на 2–3 с, обличчя повертається до того, як глядач встигне вийти з ролика. Ключові слова в плашках виділяються кольором — той самий колір по всіх шести роликах, інакше пакет розсипається візуально.
16:9 — 1920×1080. 9:16 — 1080×1920 перекадруванням: обличчя в безпечній зоні, очі у верхній третині, плашки переверстані під вузький кадр, а не масштабовані. У вертикалі окремо перевіряю, що нижні 15% не перекриті інтерфейсом майданчика.
Вшиті в кадр + окремий .srt англійською. .srt робиться
з фактичної доріжки й звіряється з нею за таймкодом — не з початкового тексту
сценарію: після заміни фрази на озвучці текст і субтитр розходяться саме тут.
У вашому ТЗ це вимога в один рядок, але саме вона вирішує вартість показу. Що я перевіряю у кожному з шести хуків:
| Сценарій | Що тримає перші 3 с | Ризик |
|---|---|---|
| A1 — дедлайн | пряме питання + дата на календарі | низький |
| A2 — дані з бірж | твердження «вони вже мають ваші дані» | низький |
| A3 — три помилки | лічильник «1 / 2 / 3» — тримає до кінця | низький |
| B4 — SMSF | вужча аудиторія, хук працює тільки на «своїх» | середній |
| B5 — пряме питання | питання в лоб + плашка | низький |
| B6 — історія клієнта | розповідь; перші 3 с найслабші з шести | середній |
Заборони в такому проєкті — не формальність: одна з них здатна зупинити модерацію всього кабінету. Тому вони в мене не «пам'ятаю», а пункт приймання по кожному файлу:
| Обмеження | Де перевіряється |
|---|---|
| Жодних обіцянок результату, «guarantee», конкретних сум економії | текст сценарію + текст плашок + субтитри (три різні місця, де слово може просочитися) |
| Презентер не називає себе бухгалтером чи співробітником практики | озвучка + плашки |
| Без державної символіки, без реальних листів податкової | кожна вставка окремо |
| Без назв бірж великим планом | вставка «екран біржі» — розмиття перевіряється покадрово |
| Без чужих логотипів на одязі й фоні | генерація аватара, до монтажу |
| Без чужих відгуків і облич реальних людей | вибір аватара |
| Без водяних знаків платформи генерації | вихідний рендер |
відео MP4 / H.264 / 25 або 30 fps / ≥ 8 Mbps
16:9 — 1920×1080 · 9:16 — 1080×1920 (перекадрування)
звук AAC 48 kHz stereo, приблизно −14 LUFS
музика тихіше голосу ≈ на 18 dB, голос розбірливий усюди
субтитри вшиті в кадр + окремий .srt (англ.), звірені з доріжкою
імена A1_deadline_16x9.mp4 · A1_deadline_9x16.mp4
A1_deadline_15s_16x9.mp4 · A1_deadline_15s_9x16.mp4 ...
вихідні тексти сценаріїв · ID аватара і голосу · аудіодоріжки
· використані вставки й плашки · проєкт монтажу
Не обіцяю, що аватар буде невідрізненний від живої зйомки. На 40 секундах великим планом уважний глядач сучасний AI-аватар упізнає — питання лише в тому, заважає це офферу чи ні. Обіцяю інше: жодного «застиглого» кадру, жодного зацикленого руху і точний липсинк на всіх стиках.
Не обіцяю показників реклами. Ролик відповідає за хук, розбірливість, темп і відповідність обмеженням — за CPM і конверсію відповідає кабінет і оффер.