Субтитры к видео нейросетью: как сделать и зачем они нужны

Значительная часть вертикального видео смотрится без звука — в транспорте, на работе, ночью рядом со спящим ребёнком. Ролик без субтитров в этой ситуации не доносит вообще ничего. Нейросеть снимает главный барьер: расшифровка речи и раскладка по таймкодам делаются автоматически, человеку остаётся вычитка и оформление. Разбираем, как это устроено и что чаще всего делают неправильно.
Почему это не опция, а норма формата
Субтитры дают три эффекта сразу: ролик работает без звука, удерживает внимание за счёт движения текста и становится доступным для людей с нарушениями слуха. Плюс площадки лучше понимают содержание ролика, когда речь распознана. Отсутствие субтитров сегодня читается как небрежность, примерно как сайт без мобильной вёрстки.
Как это делается технически
Модель распознавания речи превращает звуковую дорожку в текст с таймкодами, затем текст разбивается на фразы по 2–4 слова и накладывается на видео. Ручная работа остаётся на двух шагах: вычитать расшифровку — распознавание ошибается на именах, терминах и числах, — и проверить, что разбивка не рвёт фразу по смыслу в неудачном месте.
Где размещать текст
Нижняя треть вертикального кадра занята интерфейсом площадки: описание, кнопки, аватарка. Текст, поставленный туда по привычке из горизонтального видео, окажется под элементами интерфейса. Безопасная зона — центральная часть кадра, чуть выше середины. Проверять надо на реальном устройстве, а не в редакторе: превью врёт.
Что убивает читаемость
Тонкий шрифт без контрастной подложки на светлом фоне. Слишком длинные строки — глаз не успевает за кадром. Мелкий кегль, рассчитанный на десктоп. Анимация каждого слова отдельно, из-за которой текст мельтешит. Работает обратное: плотный жирный шрифт, тёмная полупрозрачная подложка или обводка, две-три строки максимум, спокойная смена фраз.
Субтитры и перевод — не одно и то же
Автоматический перевод субтитров выглядит соблазнительно, но на маркетинговом тексте с игрой слов и терминами он ошибается заметнее, чем на нейтральном. Для роликов, которые продают, перевод стоит вычитывать человеком. Для внутренних и обучающих — автоматического обычно достаточно.
Частые вопросы
Да, всю значимую речь. Выборочные подписи только по ключевым фразам оставляют зрителя без звука с обрывками смысла.
Для вертикального формата комфортно 2–4 слова на строку и не больше двух-трёх строк одновременно. Длиннее — зритель читает вместо того, чтобы смотреть.
Хуже, чем обычную речь. Названия брендов, аббревиатуры и профессиональные термины — первое, что нужно проверить в расшифровке перед наложением.
Мы в Telegram
Короткие новости про ИИ-генерации и ссылки на полные разборы — в канале vostorg.ai. На сайте всегда можно открыть статью целиком.
Что прочитать дальше
Что писать про план, движение камеры, свет и стиль — и какие формулировки модель просто игнорирует.
Соотношение 9:16, разрешение 1080×1920, безопасные зоны под кнопки интерфейса и длительность — чек-лист по вертикальному видео для соцсетей.
