6 октября 2026 года Сбер включил в ГигаЧате генерацию видео со звуком: нейросеть сама рисует картинку и сама озвучивает её — речью, музыкой и шумами. Для пользователей ГигаЧата это бесплатно, карта и обходные пути не нужны. Ролик получается до пяти секунд длиной и до Full HD качеством.
Для авторов коротких видео это значит, что появился работающий из России инструмент для вставок, заставок и черновых UGC-сцен. Разбираем, что он умеет, чего не умеет и как встроить пятисекундные куски в реальный ролик.
Что именно появилось
За генерацию отвечает новая модель Сбера — Kandinsky 6.0 Video. Главное её отличие от прошлых версий: картинка и звук создаются вместе, одной моделью, а не склеиваются потом. Поэтому губы персонажа двигаются под его же фразу, шаги попадают в шаг, а музыка меняется вместе со сценой.
Сцену можно задать двумя способами:
- описать текстом — что происходит, кто говорит, какие звуки нужны;
- загрузить первый кадр (своё фото или картинку) и отдельно описать, что должно происходить и как это должно звучать.
Звук можно и не включать — модель умеет делать молчаливое видео.
Характеристики: что обещает Сбер
| Параметр | Значение |
|---|---|
| Длина ролика со звуком | до 5 секунд |
| Качество | SD, HD или Full HD (до 1920×1080) |
| Частота звука | 44 кГц |
| Частота кадров | около 24 кадров в секунду |
| Что в звуке | речь с попаданием в губы, музыка, шумы окружения, эффекты |
| Цена для пользователя ГигаЧата | бесплатно |
| Время одной генерации | около 8 минут (по данным ppc.world) |
Пять секунд — это предел на сегодня. Сбер говорит, что планирует его поднять, но срока не называет.
Насколько это хорошо по сравнению с другими
Здесь важно понимать, чьи это цифры. Все сравнения ниже — заявления самого Сбера, независимых замеров пока нет:
- новая модель лучше прошлой, Kandinsky 5.0, примерно в 71% случаев по всем критериям;
- по визуальному качеству и точности движения обходит открытую модель LTX 2.5 и закрытую Veo 3.1 Fast;
- в научной статье команды сказано осторожнее: Kandinsky 6.0 Video опережает LTX 2.5 по большинству метрик теста VABench и «остаётся конкурентоспособной» с закрытыми моделями, особенно в качестве речи.
Про данные для обучения Сбер сообщил «более 20 млн видео со звуком». В статье команды разбивка подробнее: 50 млн изображений, 20 млн видеосцен, 40 млн аудиодорожек и 7 млн отрезков, где видео и звук синхронны.
Модель отдали бесплатно и разработчикам
Отдельная новость — Сбер выложил саму модель в открытый доступ по лицензии MIT. Это самая свободная из распространённых лицензий: её можно брать в коммерческие продукты.
«Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений», — Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка.
Что выложено:
| Что | Подробности |
|---|---|
| Версии модели | Lite — 3 млрд параметров, Pro — около 30 млрд |
| Апскейл до Full HD | отдельная модель на 1 млрд параметров, увеличение ×2 и ×4 |
| Где лежит | Hugging Face и GitHub |
| С чем работает | Diffusers, FAL, FastVideo, ComfyUI |
| Для локального запуска | от 16 ГБ видеопамяти (по данным «Хабра»); в карточке модели есть выгрузка частей в оперативную память, чтобы влезть в меньшую карту |
Полезная техническая деталь: сама модель генерирует видео в небольшом разрешении — 864×480. Full HD получается апскейлом отдельной моделью. То есть «Full HD» здесь — это увеличенная картинка, а не честная съёмка в 1080p. На коротких вставках разница почти не видна, но если растянуть кадр на весь экран, мягкость будет заметна.
Что делать автору коротких видео
Пять секунд — это не ролик, это деталь. Вот где они реально работают:
Заставка и концовка
Пятисекундная сцена с нужным настроением и звуком — нормальная заставка для серии роликов. Один раз сделал, ставишь во все выпуски.
Перебивка под текст за кадром
Когда вы что-то рассказываете, а показывать нечего, пятисекундная сцена закрывает дыру. Звук из модели в этом случае лучше приглушить и оставить свой голос.
Черновик для заказчика
Если вы делаете UGC и согласовываете идею, проще показать пятисекундную сцену, чем объяснять словами. Съёмка после этого идёт быстрее, потому что все уже видели, что имелось в виду.
Оживить фотографию
Режим «первый кадр + описание» — это способ сдвинуть статичную картинку. Для архивных фото, скриншотов и предметных кадров даёт больше, чем генерация с нуля.
Практика склейки простая: нарежьте 4–6 разных пятисекундных сцен, соберите их в один ролик и положите сверху общий звук. Тогда зритель не считает длину каждого куска, а разница в стиле между сценами маскируется музыкой.
Про маркировку: не забудьте
TikTok, YouTube и Instagram требуют помечать реалистичный ИИ-контент. Отметка ставится в самой платформе при загрузке, а не в ГигаЧате. Если вы делаете вставку, которую можно принять за настоящую съёмку, отметку лучше поставить: за пропуск платформы снимают охват, а в тяжёлых случаях убирают монетизацию. Абстрактная графика и явно нарисованные сцены под это требование не попадают.
Что пока неизвестно
Честно о том, чего Сбер не объяснил:
- Сколько генераций в сутки даёт бесплатный доступ. Слово «бесплатно» в пресс-релизе есть, числа лимита — нет. Проверять придётся на практике.
- Будут ли платные тарифы позже. Ничего не сказано.
- Вертикальный формат. В карточках моделей и примерах разрешение горизонтальное (864×480 и 1920×1080). Про формат 9:16, нужный для Shorts, Reels и Клипов, сообщений не было. Пока рассчитывайте, что горизонтальный кадр придётся обрезать.
- Условия использования роликов из ГигаЧата. Лицензия MIT относится к самой модели, которую вы скачиваете. Что можно делать с видео, созданным внутри сервиса ГигаЧат, определяют правила сервиса — отдельного разъяснения к этому запуску не выходило.
- Когда поднимут лимит в 5 секунд. Планы заявлены, сроков нет.
Если какой-то из этих пунктов для вас критичен — не строите на нём работу, пока Сбер не скажет прямо.
Частые вопросы
Нейросеть для создания видео бесплатно — какая работает в России?
ГигаЧат с моделью Kandinsky 6.0 Video. Это российский сервис, он открывается без обходных путей, и генерация видео в нём бесплатная. Альтернативы и их доступность мы разбирали в статье Sora закрыли: почему и чем заменить — аналоги для ИИ-видео в Shorts, Reels и UGC.
Как сделать видео со звуком в ГигаЧате?
Опишите сцену текстом и отдельно скажите, что должно звучать: кто говорит и какую фразу, какая музыка, какие шумы. Либо загрузите первый кадр и добавьте описание происходящего и звука. Выберите качество — SD, HD или Full HD. Одна генерация занимает около восьми минут.
Сколько длится видео из ГигаЧата?
До пяти секунд со звуком. Поднять лимит обещают, но когда — не сказано. Для готового ролика пятисекундные сцены нужно склеивать между собой.
Можно ли ставить такое видео в TikTok, Shorts и Reels?
Технически да. Два момента: кадр горизонтальный, под вертикальный формат его придётся обрезать, и реалистичную ИИ-сцену надо помечать при загрузке в самой платформе. Инструменты для сборки и доводки ролика собраны в статье Нейросеть для монтажа видео: 15 лучших ИИ-редакторов 2026, бесплатных и платных.
Где скачать Kandinsky 6.0 Video и что нужно для запуска?
Веса и код лежат на Hugging Face и GitHub по лицензии MIT, есть интеграция с Diffusers, ComfyUI, FAL и FastVideo. Для локального запуска, по данным «Хабра», нужно от 16 ГБ видеопамяти; версия Lite на 3 млрд параметров требует меньше, чем Pro. Если своей карты нет, проще пользоваться ГигаЧатом.
Нужны ли субтитры, если звук генерирует модель?
Да. Речь из модели короткая, а смотрят короткие видео чаще без звука. Как сделать субтитры бесплатно, мы писали здесь: Субтитры для видео бесплатно: в X их теперь правит и переводит Grok.
Бесплатные инструменты вроде этого снижают порог входа: сцену, за которую раньше платили на съёмке, теперь можно собрать за восемь минут. На Prime Oracles задания от брендов лежат открыто — в разделе «Награды за контент» видно условия и оплату за просмотры, а взять задание можно кнопкой «Взять в работу».
Источники: пресс-релиз Сбера (CNews), ixbt, «Хабр», ppc.world, модели на Hugging Face, научная статья команды.
