Нейросеть для видео
Расскажите, что должно происходить в кадре, — и получите короткий ролик. Ни камеры, ни монтажной программы для этого не нужно.
Что такое нейросеть для видео и что она умеет
Нейросеть для видео — это модель, которая делает короткий ролик по текстовому описанию или по присланной картинке. Вы описываете сцену словами, а получаете готовый видеофайл, которого до этого не существовало.
Ролик выходит коротким, и предел у каждой модели свой: Seedance делает от 4 до 15 секунд, Kling от 3 до 15, Wan от 2 до 15, а Veo выдаёт ровно 4, 6 или 8 секунд. При одном и том же описании два запуска дадут разные ролики.
Видео с помощью нейросетей делают онлайн: скачивать и устанавливать ничего не надо, приложение не требуется. Ролик считается не на вашем устройстве, поэтому подойдёт любой компьютер или телефон с браузером — и из России тоже, без VPN и без зарубежной карты.
Нейросеть для создания видео: под какие работы её берут
Короткий ролик берут туда, где нужно движение: лента в соцсетях, заставка к выпуску, кадр предметной съёмки, черновик сцены до настоящих съёмок.
Карточку товара целиком — слайды, описание и обложку — собирают на странице нейросеть для маркетплейсов, а ролик к ней делают здесь.
Как создать видео с помощью нейросети: пять шагов
- Войдите. Запуск идёт с вашего счёта, поэтому начинается всё со входа: через Яндекс или по ссылке из письма. Отдельной регистрации нет — счёт заводится сам при первом входе, и на него кладут 50 приветственных кредитов.
- Опишите сцену. Скажите, кто или что в кадре, что происходит, откуда смотрит камера и какое вокруг освещение. Одно действие на ролик: второе оставьте на следующий.
- Приложите картинку, если она есть. Тогда обстановка и предмет съёмки останутся вашими. Но картинка не всегда помогает: в одном из разборов та же сцена без приложенных изображений вышла чище, чем с ними, а при подаче двух кадров подряд предмет терялся в пространстве. Попробуйте оба пути. Снимок с человеком Seedance не примет — для такой задачи берите Kling или Wan.
- Выберите длительность и разрешение. От них зависит цена: платят за секунды, и сумма известна до запуска. Для начала берите короткий отрезок и разрешение поменьше.
- Запустите и заберите файл. Ролик считается минутами, и уйти со страницы можно: работа идёт на нашей стороне. Готовое появится в списке под формой, а с другого устройства — в кабинете, в истории запусков. Файл хранится 14 дней, но скачать его лучше сразу.
Нейросети для генерации видео: цены и отличия
Нейросеть для генерации видео здесь не одна: в таблице четыре модели, и цена за секунду у них разная. Указана самая низкая ставка семейства: внутри каждого есть уровни подешевле и подороже, а сумма растёт с разрешением и длительностью. Точное число для вашего запуска показывает форма до нажатия.
| Модель | Кто сделал | Цена от | Когда брать |
|---|---|---|---|
| Seedance 2.0 | ByteDance | от 6,49 ₽ за секунду | Когда нужно попробовать и не переплатить |
| Kling 3.0 | Kuaishou | от 7,56 ₽ за секунду | Когда в ролике нужен звук и один и тот же герой |
| MiniMax H3 | MiniMax | от 5,2 ₽ за секунду | |
| Wan 2.7 | Alibaba | от 9 ₽ за секунду | Когда сцену собирают из своих картинок и образцов |
| Seedance 2.5 | ByteDance | от 19,84 ₽ за секунду | |
| Gemini Omni 1.1 Flash | от 41 ₽ за секунду | ||
| Kling O3 | Kling | от 9,1 ₽ за секунду | |
| Wan 3.0 Video | Alibaba | от 4,5 ₽ за секунду | |
| Veo 3.1 | от 4,5 ₽ за секунду | Когда звук задаётся словами вместе с картинкой |
В таблице стоит самая низкая ставка семейства — у младшего уровня в наименьшем разрешении. С разрешением цена растёт заметно: секунда старшего Seedance в 1080p стоит 61,24 ₽.
У Kling звук оплачивается отдельно: секунда в 720p стоит 7,56 ₽ без звука и 11,34 ₽ со звуком. У Veo длительность выбирается из трёх значений, а 1080p и 4K выдаются только на восьми секундах.
У Seedance три уровня. Seedance 2.0 даёт самое высокое качество, Fast сделан ради скорости, Mini самый дешёвый. Ролик у всех трёх — от 4 до 15 секунд.
Какие нейросети для видео брать, зависит от задачи, а не от общего первого места. Списка «лучшие нейросети для видео» мы не составляем: у каждой из четырёх своё сильное место.
Все модели рядом, с ценой и единицей счёта, собраны в каталоге, а ставки всех моделей каталога — в тарифах.
Seedance 2.0: дешевле остальных и принимает больше всего
Модель ByteDance. Ролик от 4 до 15 секунд, 24 кадра в секунду, файл mp4. Разрешение до 1080p, а 4K есть только у старшего уровня — и кодируется он так, что открывается не во всяком проигрывателе.
На вход принимает больше всех остальных: текст, картинки, звук и готовое видео одновременно — до девяти изображений, до трёх видео и до трёх звуковых дорожек в одном запросе.
Уровней три, и ByteDance сам пишет, зачем каждый: Seedance 2.0 за высшим качеством, Fast когда высшее качество не нужно, Mini за лучшим соотношением цены и результата. Условия — в документации ByteDance, цены — на странице Seedance. Как собрать ролик отсюда — страница Seedance в России.
Kling 3.0: звук в кадре и один и тот же герой
Модель Kuaishou. Ролик от 3 до 15 секунд, разрешение до 4K. Главное, чем она отличается, — звук рождается вместе с картинкой, и он же меняет цену: секунда в 720p стоит 7,56 ₽ без звука и 11,34 ₽ со звуком.
Второе отличие — персонаж закрепляется. Чтобы герой не менялся, ему дают либо видео с ним, откуда модель берёт внешность и голос, либо от двух до четырёх изображений с разных сторон.
У уровня Turbo этого нет: ни 4K, ни закрепления персонажа, ни работы по последнему кадру. Что умеет каждый уровень, перечислено в карте возможностей Kling; цены — на странице Kling. Про доступ к ней отсюда — страница Kling в России.
Wan 2.7: четыре режима и правка готового ролика
Модель Alibaba. Ролик от 2 до 15 секунд, 720p или 1080p. Линейка собрана из четырёх режимов: из текста, из картинки, по образцам и правка готового ролика.
Последний режим — единственный на всей витрине, который меняет уже снятое: Alibaba описывает его как правку обычными словами, где можно поменять действия героя, реплики, внешность, обстановку, стиль и манеру съёмки. По образцам с видео и в правке ролик выходит до десяти секунд.
Alibaba обещает удержать до пяти разных персонажей, у каждого свою внешность и голос. Объявление — на сайте Alibaba Cloud, цены — на странице Wan.
Где Alibaba продаёт помесячный доступ и во что обходится у нас одна секунда ролика — на странице Как оплатить Wan из России.
Ряд выпусков Wan и то, какие из них выложены файлами наружу, разобраны на странице Wan нейросеть.
Veo 3.1: самая дешёвая секунда и звук по умолчанию
Модель Google. Длительность выбирается из трёх значений — 4, 6 или 8 секунд, 24 кадра в секунду, файл mp4. 1080p и 4K выдаются только на восьми секундах.
Звук здесь не заказывается отдельно: он рождается вместе с картинкой. Google советует описывать его отдельными предложениями и делит на три вида — отдельные звуки в кадре, фоновый шум и реплики.
Образцов берётся до трёх, и все они должны быть об одном герое или предмете. Каждый готовый ролик Google помечает скрытым водяным знаком, а делать фотореалистичное изображение известного человека модель отказывается. Условия — в документации Google, цены — на странице Veo. Что с ней из России — страница Veo в России.
Генерация видео нейросетью: один счёт на все модели
Видеомодели каталога работают с одного счёта GEN202. Заводить учётную запись у каждого разработчика и оформлять зарубежную карту для этого не требуется.
Поэтому модель берут под задачу, а не под то, где уже есть доступ. Баланс при этом общий: с него уходят и ролики, и картинки, и ответы текстовых моделей.
Те же модели раздают и чужие сервисы, только счёт у них идёт за месяц, а не за сделанную работу. Кто и что раздаёт внутри своей подписки, у кого модели собственные и сколько стоят тарифы, разобрано в рубрике Сервисы.
Тем, кто запускает ролики из своей программы, тот же счёт даёт один ключ на весь каталог — как это подключить, разобрано на странице API генерации видео.
Как описать сцену, чтобы вышло похоже
Google разложил описание на семь частей и опубликовал их порядком: кто в кадре, что он делает, в какой манере снято, где стоит и как движется камера, как построен кадр, что с резкостью и оптикой, какой свет и настроение. Последние четыре части необязательны, но без них модель выбирает их сама.
Сравните два описания одной сцены. «Женщина идёт по улице» — модель додумает и время суток, и погоду, и то, как снято. «Женщина в тёмном пальто идёт по мокрой улице вечером, камера едет за ней сзади, свет от витрин сбоку, мягкий фокус» — здесь названы шесть частей из семи, и результат окажется ближе к задуманному.
Одна сцена на ролик. Цепочка событий в одном описании выходит смазанной или незаконченной — так пишет сам Google, и это же видно на любой попытке уложить в восемь секунд две смены места.
Когда снимают из готового кадра, описывают только движение. Обстановку, внешность и свет приносит сама картинка, и повторное их описание сбивает модель.
Нейросеть для видео из фото: ролик из готового кадра
Ролик собирают не только из текста: когда кадр уже снят, его отдают модели первым кадром, и движение строится вокруг него.
Какие снимки для этого годятся, как просить движение и что чаще всего портит результат, разобрано на странице оживить фото нейросетью.
Что происходит со звуком
Звук есть у всех четырёх, но устроен по-разному. У Veo он рождается вместе с картинкой и отключить его нельзя. У Kling это отдельный режим, и он дороже. У Seedance и Wan звук включается полем в запросе.
На звучащую русскую речь рассчитывать не стоит: Kuaishou перечисляет для Kling пять языков, и русского среди них нет, а ByteDance и Alibaba перечня не публикуют. Шумы, музыка и звуки в кадре при этом получаются на всех четырёх.
Бесплатных роликов здесь нет, и вот почему
Сразу главное: нейросеть для видео бесплатно у нас не работает. Бесплатный запуск есть у картинок и у чата, а ролик для этого слишком дорогой.
Сколько это в деньгах: самый дешёвый настоящий ролик — четыре секунды у Veo в 720p — обходится в 18 ₽. Четыре секунды у Seedance в 480p — около 26 ₽. Пополнение начинается от 500 ₽, и остаток на счёте не сгорает.
Начать без вложений всё же можно: новому счёту при первом входе кладут 50 приветственных кредитов.
Почему ролик выходит не таким, как задумано
Ниже четыре причины и что делать с каждой.
- В описании было два действия. Ролик короткий, и смены места или двух событий подряд он не вместит. Оставьте одно действие, второе снимите отдельно.
- Не сказано, что делает камера. Если про камеру не сказано, движение модель выберет сама. Скажите прямо: стоит, наезжает, едет вбок, поднимается.
- Герой описан словами, а не показан. По одному тексту модель нарисует своё лицо и свою обстановку. Когда внешность важна, идите от снимка.
- В описании слишком много требований. Назовите главное одним предложением, остальное добавьте следующей попыткой.
Неудачная попытка при этом ничего не стоит: если генерация закончилась отказом, отложенные кредиты возвращаются на счёт целиком.
Ограничения генерации видео
Слабые места разработчики называют сами. Google для Veo — связную человеческую речь в коротких репликах и удержание сложной сцены целиком, когда в ней много движения. Kuaishou для режима с переносом движения — что в кадре должен быть один главный человек и что качество падает, если движение и картинка сильно расходятся.
На звучащую русскую речь в кадре рассчитывать не стоит: Kuaishou перечисляет для Kling пять языков речи, и русского среди них нет, а ByteDance и Alibaba перечня не публикуют вовсе.
Чтобы герой не менялся от ролика к ролику, его закрепляют образцами. У Kling для этого загружают видео с персонажем или от двух до четырёх его изображений, Wan обещает удержать до пяти разных персонажей, Veo берёт до трёх образцов одного героя.
Нейросеть для генерации видео людей ограничена правилами самих разработчиков. Снимок с настоящим человеческим лицом Seedance на вход не принимает — это её собственное ограничение, и обойти его можно только своими же прежними результатами за последние тридцать дней. Для оживления портрета берите другую модель.
На съёмке всплывает и то, о чём разработчики не пишут. Отражения не сходятся с кадром: машина в отражении едет в другую сторону, чем в самом кадре, а иногда отражение раздваивается. Описание длиной в целый абзац модель не вытягивает — картинка начинает ехать целиком, будто привязана к движущейся машине.
Своё видео на вход загружается не всегда: сборка срывается на последнем шаге. Обходят это тем, что пережимают файл перед загрузкой.
Частые вопросы
Можно ли сделать видео из фотографии
Можно: снимок загружается в ту же форму, и нейросеть для создания видео из фото добавляет движение камеры и предмета съёмки. Так оживляют старые фотографии и делают короткие ролики из предметной съёмки.
Нейросеть для видео из фото разобрана подробно на странице оживить фото. А если снимка нет и ролик собирается по одному описанию — это страница видео по тексту.
Можно ли смонтировать или улучшить готовое видео
Здесь ролик создаётся заново — по описанию, по вашей картинке или по образцу. У Wan 2.7 есть режим, который перерисовывает готовый ролик по описанию: так меняют сцену, одежду или стиль.
Склейки нескольких роликов, повышения чёткости и перевода звуковой дорожки у нас нет.
На каком языке писать описание сцены
Русская нейросеть для видео в каталоге не стоит, зато сайт, оплата и поддержка — на русском. Перечня языков, на которых принимают описание, разработчики моделей не публикуют, поэтому обещать за них мы не будем: если результат вышел не тем, попробуйте то же описание по-английски.
Точнее всего выходит то, что названо действием. Обороты вроде «атмосферно» и «красиво» модель толкует по-своему.
Сколько стоит ролик и бывает ли бесплатно
Ролик оплачивается посекундно, и сумму запуска видно до нажатия. Бесплатной генерации видео здесь нет: она стоит десятки и сотни кредитов, и дарить её мы не можем.
Начать можно без вложений: при первом входе на счёт кладут 50 приветственных кредитов. Дальше пополнение идёт рублями, от 500 ₽, и остаток на счёте не сгорает.
Если ролики нужно делать не руками, а из своей программы, это API генерации видео.