Вы отправляете текстовый промпт для рекламной сцены с диалогом, а в ответ приходит немое кино. Чтобы персонаж заговорил, вам приходится отдельно генерировать голос другой нейросетью, искать фоновые шумы и вручную сводить звук с движением губ. У большинства видеомоделей нашего каталога потолок длины упирается в 15–16 секунд. Модель FLUX 3 Video меняет механику: вы запрашиваете двадцатисекундный ролик, и сервер возвращает готовый файл с уже синхронизированной аудиодорожкой за один вызов.
Звук из коробки и языки генерации
Разработчик Black Forest Labs выпустил FLUX 3 как мультимодальную систему. Главное отличие ее видеоверсии от многих соседних решений — нативная работа со звуком. Нейросеть не просто накладывает случайный шум поверх сгенерированного видеоряда. Она синтезирует речь, сводит движения губ персонажа с произносимыми словами и добавляет фоновые эффекты, которые соответствуют происходящему в кадре. Все это происходит внутри одного процесса.
Звук включен по умолчанию. Если вам нужен только визуальный ряд для дальнейшего сложного монтажа, вы можете выключить генерацию аудио. Для этого передайте в запросе параметр audio со значением false.
Вендор перечисляет тринадцать языков речи и оговаривается, что поддерживает больше. В их числе английский, испанский, китайский, французский, немецкий, японский, итальянский и хинди. В официальном списке присутствует и русский язык. Здесь я сразу обозначу пробел: мы не проверяли качество русской речи на естественность и правильность интонаций. Мы опираемся исключительно на спецификации создателей. Если вы строите продукт для локального рынка, вам придется сделать несколько тестовых прогонов и оценить произношение самостоятельно.
Двадцатисекундный лимит и управление кадрами
Вторая проблема, которую закрывает модель — длина сцены. Вы можете запросить любое целое число от 5 до 20, передав его в параметре seconds. Видео рендерится с кинематографичной частотой 24 кадра в секунду. Выбор разрешений стандартный: 720p для базовых задач и 1080p для Full HD.
Помимо генерации по тексту, API принимает на вход стартовые изображения. Это работает через параметр image. Вы передаете массив ссылок на картинки. Если внутри одна ссылка, нейросеть берет ее как первый кадр и оживляет сцену, отталкиваясь от него. Это удобно, когда у вас есть готовый концепт-арт, который нужно привести в движение.
Если вы передаете две ссылки, модель строит анимацию так, чтобы начать с первой картинки и закончить ровно на второй. Нейросеть сама рассчитывает промежуточные состояния. Такой контроль полезен для продуктовой анимации. Вы можете заранее подготовить идеальный стартовый кадр — например, прогнав его через правку картинок FLUX Kontext Pro, — а затем отдать его видеомодели для финального рендера.

Как устроен асинхронный запрос к API
Генерация двадцати секунд видео со звуком требует огромных вычислительных мощностей. Сервер физически не может отдать готовый файл мгновенно. Если ваш код попытается держать HTTP-соединение открытым до победного конца, оно оборвется по таймауту сети. Ваш клиент решит, что сервер упал, хотя рендер все еще идет.
Поэтому работа строится асинхронно. Вы отправляете POST-запрос с описанием задачи, указываете параметр resolution и нужные пропорции экрана в aspect_ratio. Пропорции можно задать жестко, например 16:9 для десктопа или 9:16 для мобильных форматов. Сервер отвечает, что задача принята, и выдает ее идентификатор. Дальше ваш скрипт периодически опрашивает сервер по этому ID.
Как только рендер заканчивается, статус меняется на completed, и в ответе появляется прямая ссылка на готовый файл. Ниже мы приводим рабочий код на Python. Он создает задачу и раз в десять секунд проверяет ее готовность. Ключ авторизации подтягивается из переменной окружения.
import os
import time
import requests
api_key = os.environ.get("ALTROUTER_API_KEY")
if not api_key:
raise ValueError("Не найден ключ ALTROUTER_API_KEY")
headers = {
"Authorization": f"Bearer {api_key}",
"Content-Type": "application/json"
}
post_url = "https://api.altrouter.ai/v1/videos"
payload = {
"model": "flux-3-video",
"prompt": "Cinematic shot of a cyberpunk city at night, neon lights reflecting in puddles. A narrator says 'The future is already here'.",
"seconds": 10,
"resolution": "720p",
"aspect_ratio": "16:9",
"audio": True,
# Ключевые кадры (раскомментируйте): первая ссылка - начальный кадр, вторая - конечный
# "image": ["https://example.com/start.jpg", "https://example.com/end.jpg"],
}
print("Отправка задачи...")
response = requests.post(post_url, headers=headers, json=payload)
response.raise_for_status()
task_data = response.json()
task_id = task_data.get("id")
print(f"Задача принята. ID: {task_id}")
get_url = f"https://api.altrouter.ai/v1/videos/{task_id}"
while True:
status_response = requests.get(get_url, headers=headers)
status_response.raise_for_status()
status_data = status_response.json()
current_status = status_data.get("status")
if current_status == "completed":
print("\nВидео успешно сгенерировано!")
print("Ссылка на файл:", status_data.get("url"))
break
elif current_status == "failed":
print("\nПроизошла ошибка при генерации видео.")
break
print("Статус: в очереди/в работе. Ожидание 10 секунд...")
time.sleep(10)

Наш замер времени: сколько ждать результат
Вам нужно понимать реальные задержки, чтобы правильно выстроить интерфейс приложения. Если пользователь нажмет кнопку и не получит обратной связи в течение минуты, он закроет вкладку. Интерфейс должен показывать прогресс или предупреждать о долгом ожидании.
На 16.09.2026 мы прогнали тестовую задачу через нашу инфраструктуру. Ролик на 5 секунд в разрешении 720p с включенным звуком потребовал 72 секунды от момента отправки первого запроса до получения статуса completed.
Дыра в нашем замере: мы сделали всего один прогон. Мы не выравнивали время суток, не проверяли пиковые нагрузки на кластер вендора и не замеряли время для тяжелого формата 1080p. Очевидно, что двадцать секунд в Full HD заставят ваш код ждать несколько минут. Учитывайте это при проектировании архитектуры. Не ставьте жесткие таймауты на стороне клиента, иначе вы потеряете результат, за который уже заплатили.
Цена за секунду и проблема с тарификацией 1080p
Видеомодели тарифицируются за секунду готового материала, а не за текстовые токены. На 16.09.2026 официальная цена Black Forest Labs для разрешения 720p составляет $0.17 за секунду. Наша цена для того же разрешения — $0.17986 за секунду, это на 6% выше официальной цены Black Forest Labs. Никаких скидок на эту модель у нас нет, вы платите небольшую премию за доступ через единый интерфейс.
Для разрешения 1080p есть отдельная сложность, о которой нужно знать до запуска в продакшен. В нашем каталоге сейчас нет явно прописанной цифры для Full HD. При этом у официального вендора генерация в 1080p стоит $0.29 за секунду. Это в 1,7 раза дороже базового качества.
Наша система работает по факту рендера. В момент отправки запроса мы резервируем средства на балансе. После успешного завершения задачи мы списываем точную сумму. Поскольку 1080p требует больше ресурсов, итоговое списание будет соответствовать повышенной стоимости. Вы увидите финальную цифру в истории списаний только после того, как файл будет готов. Если рендер упадет с ошибкой, резерв снимется и списания не будет.
| Длительность | Наша цена 720p | Официальная цена 720p | Официальная цена 1080p |
|---|---|---|---|
| 5 секунд | ~$0.90 | $0.85 | $1.45 |
| 10 секунд | ~$1.80 | $1.70 | $2.90 |
| 20 секунд | ~$3.60 | $3.40 | $5.80 |

Ограничения нашего шлюза и выбор альтернатив
При интеграции через нас вы получаете доступ не ко всем функциям разработчика. У Black Forest Labs существует режим чернового рендера, который стоит дешевле, а также функция продолжения готового видео с сохранением звука. Сейчас мы эти возможности не поддерживаем. Вам доступны базовая генерация по тексту и работа с ключевыми кадрами.
FLUX 3 Video — дорогой инструмент. Если задача не требует сложного звука и двадцати секунд хронометража, логично посмотреть на соседей по каталогу. На 16.09.2026 генерация одной секунды в модели Vidu Q3 Turbo стоит $0.0654 при лимите в 16 секунд. Это почти в три раза дешевле. Такой вариант идеально подходит для немых фоновых роликов на сайт.
Если звук все же нужен, но бюджет ограничен, обратите внимание на базовую версию Vidu Q3. На 16.09.2026 она обойдется в $0.1587 за секунду. Еще один вариант — Seedance 2.0 за $0.246 за секунду с лимитом в 15 секунд. Механику ценообразования в медийных нейросетях мы подробно разбирали в тексте про то, сколько стоит видео нейросеть. Общую сводку по инструментам можно найти в материале про нейросети для видео.
Чего эта модель не решает
FLUX 3 Video не подходит для сервисов реального времени. Вы не сможете использовать ее для видеозвонков или моментальных ответов чат-бота. Минутные задержки убьют весь пользовательский опыт. Интерфейс должен быть спроектирован так, чтобы человек мог уйти по своим делам и получить пуш-уведомление о готовности.
Модель также не решает проблему бюджетов для массовых бесплатных продуктов. Отдавать почти доллар за каждый пятисекундный запрос от случайного пользователя экономически нецелесообразно. Инструмент окупается там, где ценность готовой сцены со звуком превышает затраты на ее производство.
Документация и технические параметры лежат на странице каталога FLUX 3 Video. Получить ключ для интеграции и запустить свои тесты можно на главной странице altrouter.ai.
FAQ
Сколько стоит FLUX 3 Video по API?
Официальная цена Black Forest Labs составляет $0.17 за секунду видео в разрешении 720p и $0.29 за секунду в 1080p. В нашем сервисе генерация 720p стоит $0.17986 за секунду. Ролики в 1080p тарифицируются по факту рендера и обходятся дороже базового качества.
Как сгенерировать видео длиннее 10 секунд?
Вам нужно передать параметр seconds в теле JSON-запроса. Модель поддерживает любое целое значение от 5 до 20. Учитывайте, что увеличение длительности пропорционально увеличивает итоговую стоимость и время ожидания готовности файла.
Можно ли отключить звук при генерации видео?
Да, звук генерируется по умолчанию, но вы можете его отключить. Для этого в теле POST-запроса передайте параметр audio со значением false. Это полезно, если звуковую дорожку вы планируете накладывать на этапе монтажа.
Как передать начальный и конечный кадр?
В теле запроса предусмотрен параметр image, который принимает массив URL-адресов. Одна ссылка в массиве станет начальным кадром. Если передать две ссылки, первая будет использована как старт ролика, а вторая — как финальный кадр.
Почему API не возвращает видео сразу?
Рендеринг видео — ресурсоемкий процесс, занимающий от одной до нескольких минут. API работает асинхронно: в ответ на POST-запрос вы мгновенно получаете ID задачи, после чего ваш скрипт должен периодически отправлять GET-запросы, пока статус не изменится на completed.