Промпт для генерации видео: как описать кадр, чтобы получилось

Генеративное видео делает ровно то, что вы описали, и почти никогда — то, что вы представляли. Разница между «получилось» и «мусор» лежит не в модели, а в промпте: в нём должны быть план, движение, свет и стиль, причём словами, которые описывают изображение, а не замысел. Ниже — рабочая схема и типичные формулировки, которые не работают.
Четыре обязательных слоя промпта
Первый — что в кадре: объект, его состояние, окружение. Второй — как снято: крупный, средний или общий план, ракурс, глубина резкости. Третий — движение: что делает объект и что делает камера. Четвёртый — свет и стиль: время суток, источник света, настроение, референс визуального языка. Пропуск любого слоя модель заполнит сама, и почти наверняка не так, как вы ждали.
Пишите изображение, а не замысел
«Ролик, который вызывает доверие к бренду» — это задача для маркетолога, а не описание кадра. Модель не знает, как выглядит доверие. Переведите замысел в видимое: «руки распаковывают коробку на деревянном столе, тёплый утренний свет из окна сбоку, медленный наезд камеры». Правило простое: если фразу нельзя нарисовать, модель её проигнорирует.
Движение камеры — отдельная строка
Именно движение отличает видео от анимированной картинки. Формулируйте его прямо: медленный наезд, отъезд, панорама слева направо, облёт объекта, статичный штатив. Не просите сразу несколько разнонаправленных движений в одном коротком клипе — модель смешает их и получится дрожание. Одно движение на клип.
Чего просить не стоит
Читаемого текста в кадре: буквы почти всегда получаются искажёнными, надписи надёжнее накладывать на монтаже. Точной копии реального бренда или логотипа. Сложных сцен с несколькими взаимодействующими людьми — руки и лица в динамике до сих пор слабое место. Длинных сюжетов одним клипом: длинное собирается из коротких.
Итерация вместо переписывания
Получив неудачный результат, не переписывайте промпт целиком — меняйте один слой за раз. Не тот свет — правьте только про свет. Слишком быстро — только про движение. Так вы за три-четыре итерации поймёте, какая формулировка на что влияет, и соберёте собственный набор рабочих шаблонов, который дальше экономит часы.
Частые вопросы
Большинство моделей лучше понимают английский, но качественные русские промпты тоже работают. Практичнее держать шаблон на том языке, на котором вам удобно быстро править.
Генерация вероятностная: при одинаковом запросе модель каждый раз выбирает новый вариант. Поэтому нормальная практика — сгенерировать несколько дублей и выбрать лучший, а не добиваться повторяемости.
Через генерацию из фото товара, а не из текста: модель получает исходное изображение и оживляет его. Текстовый промпт в этом случае описывает движение и окружение.
Мы в Telegram
Короткие новости про ИИ-генерации и ссылки на полные разборы — в канале vostorg.ai. На сайте всегда можно открыть статью целиком.
Что прочитать дальше
Крючок, проблема, решение, доказательство, призыв — сколько секунд на каждый блок и где обычно ломается ролик.
Большинство смотрит без звука. Как сделать субтитры нейросетью, где их размещать и что убивает читаемость.
Повторить структуру и ритм удачного ролика — можно. Скопировать чужое видео и лицо — нельзя, и вот почему.
