Коротко
Видеомодели различаются не столько качеством картинки, сколько четырьмя вещами: максимальной длительностью, наличием звука, разрешением и тем, как вы задаёте сцену. Именно по ним и стоит выбирать — разницу в кадре между топовыми моделями обычный зритель не заметит, а разницу в 8 и 15 секунд заметит сразу.
Сегодня доступно семь моделей. Если очень коротко:
- Оживить фотографию — Hailuo 2.3, она этим и занимается.
- Сцена из текста со звуком — Veo 3.1 или Kling.
- Длинный ролик до 15 секунд — Kling 3.0, Wan 2.7 или Seedance 2.0.
- Много роликов дёшево — Hailuo или Kling 2.6.
Ниже — как эти параметры устроены, полная таблица и что нужно знать, чтобы встроить генерацию в продукт.
Два способа задать сцену
Вся генерация видео делится на два режима, и от выбора зависит почти всё остальное.
Text-to-video. Вы описываете сцену словами, модель придумывает всё — композицию, свет, персонажей. Свободы больше, предсказуемости меньше: одна и та же формулировка даёт разные результаты.
Image-to-video. Вы даёте первый кадр, модель достраивает движение. Композиция ваша, придумывает модель только движение. Предсказуемость выше, и промпт должен описывать не картинку, а то, что в ней происходит.
Второй режим — это то, что обычно называют «оживить фото». Он же самый популярный запрос ко всей теме, и разобран у нас отдельно.
Важная деталь: не все модели умеют оба режима. Hailuo 2.3 работает только из изображения — text-to-video у неё нет вовсе, запрос без картинки вернёт ошибку.
Четыре параметра выбора
Длительность
Диапазон больше, чем ждут: от 8 секунд у Veo до 15 у Kling 3.0, Wan 2.7 и Seedance.
Практически это значит, что минуту одним куском не сделает никто. Любой длинный ролик — это сцены, которые вы монтируете сами. Планируя работу, считайте сразу в сценах.
Звук
Тут три разные ситуации, и их важно не путать:
- Звук в цене — Veo 3.1, у неё дорожка часть основного сценария.
- Звук за отдельные деньги — Kling: включение удваивает ставку за секунду.
- Звук как опция — Wan 2.7, дорожка есть, но это не её сильная сторона.
Если музыку вы всё равно положите на монтаже, генерировать звук незачем — это прямая переплата.
Разрешение
От 480p до 4K, но осторожно: у части моделей разрешение — это ценовой тир, а не настройка. У Seedance на цену влияет и разрешение, и длительность; у Kling 3.0 режимы std / pro / 4K стоят по-разному. Veo фиксирована на 1080p, а 4K требует отдельного вызова и стоит дороже.
Соотношение сторон
Мелочь, которая всплывает в последний момент. Не все модели дают вертикаль: 9:16 есть у Veo, Kling и Seedance, у Seedance выбор шире всего — вплоть до 21:9. Если вы делаете контент для вертикальных лент, проверьте это до того, как выберете модель по другим признакам.
Все семь моделей
| Модель | Режимы | Длительность | Звук | Разрешение |
|---|---|---|---|---|
| Hailuo 2.3 | только из кадра | 6 или 10 сек | — | 768P / 1080P |
| Kling 2.6 | текст и кадр | 5 или 10 сек | ×2 к цене | — |
| Kling 3.0 | текст и кадр | 3–15 сек | ×2 к цене | std / pro / 4K |
| Wan 2.7 Video | текст и кадр | 2–15 сек | есть | 720p / 1080p |
| Seedance 2.0 | текст и кадр | 4–15 сек | есть | 480p / 720p / 1080p |
| Veo 3.1 Fast | текст и кадр | 4, 6 или 8 сек | в цене | 1080p |
| Veo 3.1 | текст и кадр | 4, 6 или 8 сек | в цене | 1080p |
Цены здесь намеренно не дублируются: у моделей разные единицы тарификации, и сравнивать их в одной строке с параметрами — способ ошибиться. Полный расчёт по минутам и по проектам — в отдельной статье.
Чем модели отличаются по существу
Hailuo 2.3 — узкая специализация на оживлении кадра: реалистичное движение, мимика, свет. На людях и лицах даёт лучший результат за свои деньги.
Kling 2.6 и 3.0 — синхронный звук, речь и эффекты. У 3.0 добавились многокадровые сцены до 15 секунд и режим 4K. Особенность API: 3.0 требует явного параметра многокадровости, без него запрос не пройдёт.
Wan 2.7 Video — универсал с negative_prompt и seed. Второе недооценивают: seed даёт воспроизводимость, то есть возможность повторить удачный дубль, а не ловить его заново.
Seedance 2.0 — сильная консистентность между кадрами, сцена не «плывёт». Самый широкий выбор соотношений сторон. Заметно дороже остальных посекундных.
Veo 3.1 — кинематографичный кадр и звук как часть модели. Тарифицируется за ролик, а не за секунду, поэтому длительность у неё фактически бесплатна: берите максимум и режьте на монтаже.
Как это встроить в продукт
Главное отличие видео от текста и картинок: рендер идёт минутами, поэтому API асинхронный. Вы создаёте задачу, получаете id, дальше опрашиваете статус.
import time, requests
BASE = "https://api.altrouter.ai/v1"
H = {"Authorization": "Bearer sk-..."}
job = requests.post(f"{BASE}/videos", headers=H, json={
"model": "kling-2.6",
"prompt": "камера медленно облетает чашку кофе на столе у окна, утренний свет",
"duration": "5",
}).json()
while True:
r = requests.get(f"{BASE}/videos/{job['id']}", headers=H).json()
if r["status"] in ("completed", "failed"):
break
time.sleep(5)
print(r.get("url"), r["status"])
Четыре вещи, которые стоит заложить в архитектуру сразу.
Очередь на вашей стороне. Пользователь не должен ждать ответа в HTTP-запросе несколько минут. Ставьте задачу, отдавайте идентификатор, показывайте статус.
Опрос раз в 3–5 секунд. Чаще бессмысленно и упирается в лимит скорости.
Ссылка на результат не вечная. Скачивайте готовый ролик к себе, если он нужен дольше, чем на показ.
Деньги резервируются при создании задачи и списываются по факту удавшегося рендера. Упавший рендер не оплачивается.
Чего ждать не стоит
Ограничения общие для всех моделей, и лучше знать их заранее.
- Руки и пальцы — классическая слабость. Крупный план рук почти гарантированно потребует нескольких попыток.
- Текст в кадре расползается при движении. Надписи лучше накладывать на монтаже.
- Точный сценарий не задаётся промптом. Промпт — пожелание, а не раскадровка. Сложное движение проще собрать из нескольких коротких роликов.
- Длинные ролики уплывают. Чем дальше от первого кадра, тем сильнее модель уходит от исходной композиции.
- С первого раза не получится. Закладывайте 2–3 рендера на пригодный дубль — это не пессимизм, а норма жанра.
Все семь моделей с текущими ценами — на витрине. На пробу хватит $1, которые начисляются за подтверждённый Telegram.
FAQ
Какая нейросеть лучше для создания видео?
Зависит от задачи, а не от общего рейтинга. Для оживления фотографии — Hailuo 2.3, для кинематографичной сцены со звуком — Veo 3.1, для длинного ролика до 15 секунд — Kling 3.0, Wan 2.7 или Seedance 2.0, для большого объёма недорого — Hailuo или Kling 2.6.
Сколько секунд видео может сгенерировать нейросеть за раз?
От 8 секунд у Veo 3.1 до 15 у Kling 3.0, Wan 2.7 Video и Seedance 2.0. Минуту одним запросом не сделает ни одна модель: длинное видео всегда собирается из отдельных сцен и монтируется вручную.
Чем отличается генерация видео из текста и из фото?
В text-to-video модель придумывает всю сцену по описанию — свободы больше, предсказуемости меньше. В image-to-video вы задаёте первый кадр, и модель достраивает только движение, поэтому результат ближе к задуманному. Промпт во втором случае должен описывать движение, а не картинку.
У всех ли видеомоделей есть звук?
Нет, и устроен он по-разному. У Veo 3.1 звук входит в цену, у Kling включение дорожки удваивает ставку за секунду, у Wan 2.7 и Seedance звук есть как опция, у Hailuo 2.3 его нет. Если музыка всё равно ляжет на монтаже, генерировать звук не нужно.
Почему генерация видео идёт так долго?
Потому что модель просчитывает десятки кадров, а не один ответ, — это минуты вычислений. Поэтому API асинхронный: вы создаёте задачу, получаете идентификатор и опрашиваете статус, а не ждёте ответа в одном HTTP-запросе.
Можно ли получить одинаковый результат дважды?
Только там, где есть параметр seed — из доступных моделей он выведен у Wan 2.7 Video. У остальных повтор запроса с той же формулировкой даст похожий, но другой ролик, поэтому удачный дубль стоит сразу сохранять.