El 6 de octubre de 2026 Sber activó la generación de vídeo con sonido dentro de GigaChat: la red neuronal dibuja la imagen y la sonoriza ella misma — voz, música y ruidos del entorno. Para los usuarios de GigaChat es gratis, sin tarjeta y sin rodeos. Los clips llegan hasta cinco segundos y hasta calidad Full HD.
Para los creadores de vídeo corto esto significa que ya existe una herramienta de vídeo con IA que funciona desde Rusia: sirve para insertos, cabeceras y escenas UGC de borrador. Veamos qué hace, qué no hace y cómo encajar trozos de cinco segundos en un vídeo real.
Qué se ha lanzado exactamente
La generación corre sobre el nuevo modelo de Sber, Kandinsky 6.0 Video. Su diferencia principal con las versiones anteriores: imagen y sonido se crean juntos, con un solo modelo, en vez de pegarse después. Por eso los labios del personaje se mueven al ritmo de su propia frase, los pasos caen en el paso y la música cambia junto con la escena.
La escena se puede plantear de dos maneras:
- describirla con texto — qué ocurre, quién habla, qué sonidos hacen falta;
- subir el primer fotograma (una foto propia o una imagen) y describir aparte qué debe pasar y cómo debe sonar.
El sonido es opcional: el modelo también sabe hacer vídeo mudo.
Características: lo que promete Sber
| Parámetro | Valor |
|---|---|
| Duración del clip con sonido | hasta 5 segundos |
| Calidad | SD, HD o Full HD (hasta 1920×1080) |
| Frecuencia de audio | 44 kHz |
| Fotogramas por segundo | unos 24 |
| Qué incluye el audio | voz sincronizada con los labios, música, ruido ambiente, efectos |
| Precio para el usuario de GigaChat | gratis |
| Tiempo de una generación | unos 8 minutos (según ppc.world) |
Cinco segundos es el techo de hoy. Sber dice que piensa subirlo, pero no da fecha.
Qué tan bueno es frente a los demás
Aquí importa de quién son las cifras. Todas las comparaciones de abajo son afirmaciones de Sber; todavía no hay mediciones independientes:
- el nuevo modelo gana al anterior, Kandinsky 5.0, en aproximadamente el 71% de los casos en todos los criterios;
- en calidad visual y precisión del movimiento supera al modelo abierto LTX 2.5 y al cerrado Veo 3.1 Fast;
- el artículo científico del equipo lo dice con más cautela: Kandinsky 6.0 Video va por delante de LTX 2.5 en la mayoría de las métricas del test VABench y «sigue siendo competitivo» con los sistemas propietarios, sobre todo en calidad de voz.
Sobre los datos de entrenamiento, Sber informó de «más de 20 millones de vídeos con sonido». El artículo da un desglose más detallado: 50 millones de imágenes, 20 millones de escenas de vídeo, 40 millones de pistas de audio y 7 millones de fragmentos en los que vídeo y sonido están sincronizados.
El modelo también se entregó gratis a los desarrolladores
Noticia aparte: Sber publicó el modelo en abierto con licencia MIT. Es la más permisiva de las licencias habituales: se puede usar en productos comerciales.
«El modelo Kandinsky 6.0 Video lo entregamos a los desarrolladores gratis y sin restricciones», dijo Antón Frolov, vicepresidente sénior y responsable del área de Desarrollo de IA Generativa de Sberbank.
Qué se ha publicado:
| Qué | Detalles |
|---|---|
| Versiones del modelo | Lite — 3.000 millones de parámetros, Pro — unos 30.000 millones |
| Escalado a Full HD | un modelo aparte de 1.000 millones de parámetros, ×2 y ×4 |
| Dónde está | Hugging Face y GitHub |
| Con qué funciona | Diffusers, FAL, FastVideo, ComfyUI |
| Para ejecutarlo en local | desde 16 GB de memoria de vídeo (según Habr); la ficha del modelo permite descargar partes a la RAM para caber en una tarjeta menor |
Un detalle técnico útil: el modelo genera el vídeo en una resolución pequeña — 864×480. El Full HD sale de un escalado con un modelo aparte. Así que «Full HD» aquí es una imagen ampliada, no una captura real en 1080p. En insertos cortos la diferencia casi no se nota, pero estirada a pantalla completa la blandura se ve.
Qué hacer con esto si creas vídeo corto
Cinco segundos no es un vídeo, es un detalle. Aquí es donde esos detalles sí funcionan:
Cabecera y cierre
Una escena de cinco segundos con el tono y el sonido adecuados es una cabecera perfectamente válida para una serie. La haces una vez y la pones en todos los episodios.
Un recurso para tapar la voz en off
Cuando estás contando algo y no tienes qué mostrar, una escena de cinco segundos cubre el hueco. En ese caso baja el audio del modelo y deja tu propia voz.
Un borrador para el cliente
Si haces UGC y hay que acordar una idea, enseñar una escena de cinco segundos es más fácil que explicarla. El rodaje después va más rápido, porque todos ya han visto a qué te referías.
Dar vida a una fotografía
El modo «primer fotograma + descripción» sirve para mover una imagen fija. Con fotos de archivo, capturas de pantalla y planos de producto da más que generar desde cero.
El montaje es sencillo: corta 4–6 escenas distintas de cinco segundos, júntalas en un vídeo y pon una sola pista de audio por encima. Así el espectador deja de contar la duración de cada trozo, y la música tapa las diferencias de estilo entre escenas.
No olvides la etiqueta de IA
TikTok, YouTube e Instagram exigen etiquetar el contenido de IA realista. La etiqueta se pone dentro de la plataforma al subir, no en GigaChat. Si tu inserto puede pasar por grabación real, etiquétalo: las plataformas recortan el alcance cuando falta y, en casos graves, quitan la monetización. Los gráficos abstractos y las escenas claramente dibujadas no entran en el requisito.
Qué sigue sin saberse
Con honestidad, lo que Sber no explicó:
- Cuántas generaciones al día permite el acceso gratuito. La palabra «gratis» está en el comunicado; el número del límite, no. Habrá que comprobarlo en la práctica.
- Si más adelante habrá planes de pago. No se ha dicho nada.
- Formato vertical. Las fichas de los modelos y los ejemplos muestran resoluciones horizontales (864×480 y 1920×1080). No ha habido mención del 9:16, el formato que necesitan Shorts, Reels y Clips. Por ahora cuenta con tener que recortar un cuadro horizontal.
- Las condiciones de uso de los clips hechos dentro de GigaChat. La licencia MIT cubre el modelo que descargas. Lo que puedes hacer con el vídeo creado dentro del servicio GigaChat lo deciden las reglas del servicio, y con este lanzamiento no salió ninguna aclaración aparte.
- Cuándo subirá el límite de 5 segundos. Los planes están anunciados, las fechas no.
Si alguno de estos puntos es crítico para ti, no montes tu trabajo sobre él hasta que Sber lo diga claramente.
Preguntas frecuentes
¿Qué generador de vídeo IA gratis funciona desde Rusia?
GigaChat con el modelo Kandinsky 6.0 Video. Es un servicio ruso, se abre sin rodeos y la generación de vídeo es gratuita. Las alternativas y su disponibilidad las repasamos en Sora cierra: por qué y con qué sustituirlo — alternativas de vídeo IA para Shorts, Reels y UGC.
¿Cómo se hace un vídeo con sonido en GigaChat?
Describe la escena con texto y di aparte qué debe oírse: quién habla y qué frase, qué música, qué ruidos. O sube el primer fotograma y añade la descripción de la acción y del audio. Elige la calidad: SD, HD o Full HD. Una generación tarda unos ocho minutos.
¿Cuánto dura un vídeo de GigaChat?
Hasta cinco segundos con sonido. Prometen subir el límite, pero sin fecha. Para un vídeo terminado hay que unir varias escenas de cinco segundos.
¿Se puede publicar este vídeo en TikTok, Shorts y Reels?
Técnicamente sí. Dos matices: el cuadro es horizontal y habrá que recortarlo para el formato vertical, y una escena de IA realista hay que etiquetarla al subirla dentro de la plataforma. Las herramientas para montar y acabar el vídeo están recogidas en Programas de montaje con IA: 15 mejores editores de 2026, gratis y de pago.
¿Dónde se descarga Kandinsky 6.0 Video y qué hace falta para ejecutarlo?
Los pesos y el código están en Hugging Face y GitHub con licencia MIT, con integraciones para Diffusers, ComfyUI, FAL y FastVideo. Para ejecutarlo en local hacen falta desde 16 GB de memoria de vídeo, según Habr; la versión Lite de 3.000 millones de parámetros pide menos que la Pro. Si no tienes la tarjeta, lo cómodo es usar GigaChat.
¿Hacen falta subtítulos si el modelo genera el audio?
Sí. La voz del modelo es corta, y el vídeo corto se ve casi siempre sin sonido. Cómo hacer subtítulos gratis: Subtítulos de vídeo gratis: X ya los corrige y traduce con Grok.
Las herramientas gratuitas como esta bajan la barrera de entrada: una escena que antes se pagaba en un rodaje ahora se monta en ocho minutos. En Prime Oracles las tareas de las marcas están a la vista: en la sección Recompensas por contenido se ven las condiciones y el pago por visualizaciones, y se coge una tarea con el botón Aceptar tarea.
Fuentes: comunicado de Sber (CNews), ixbt, Habr, ppc.world, modelos en Hugging Face, artículo científico del equipo.
