Vídeo sin rodaje: del guion al vídeo terminado en minutos.
AiST Video monta vídeos formativos, publicitarios y de producto a partir de texto, imágenes y su archivo: avatar Ai del locutor, montaje automático, doblaje, subtítulos, troceado de contenido largo en shorts. Un mismo vídeo — para Reels, Shorts, VK Clips, Dzen y el LMS corporativo, con doblaje a más de 30 idiomas. Sin cámara, sin actor, sin montador. Guion → vídeo en 3–5 minutos en lugar de dos semanas de producción. T&D, marketing y PR lanzan un curso de 50 lecciones en una semana — antes, un año y el presupuesto de un coche.
- ▶ Text-to-video & image-to-video
- ◉ Avatar Ai del locutor + lipsync
- ≋ Doblaje a más de 30 idiomas
- ⌖ Troceado automático en Reels / Shorts / VK Clips
- ⛨ 152-ФЗ · on-prem · brand-safety
El vídeo es el contenido más caro. Y ya no se puede prescindir de él.
El 90% de las redes sociales, el 70% de la formación y la mitad de la publicidad son vídeo. Pero cada pieza supone rodaje, actor, montaje, gráficos, dos semanas y la factura de la productora. El negocio choca con el techo de producción de contenido audiovisual.
Un vídeo formativo — miles de euros y un mes
Guion, casting del locutor, estudio, montaje, gráficos, correcciones. Un curso corporativo de 50 lecciones se convierte en un año de trabajo y el presupuesto de un coche de gama alta.
SMM quiere 30 shorts a la semana
VK Clips, Reels, Shorts — los algoritmos premian a quien publica mucho. Usted tiene webinars e entrevistas largas — pero no hay quien las trocee en 30 clips verticales con subtítulos.
Lanzamiento en 5 países = 5 producciones
Un curso formativo en 5 idiomas son 5 locutores, 5 estudios, 5 montajes. La localización consume el 80% del presupuesto de un lanzamiento regional.
Del texto del guion — al vídeo terminado en la plataforma de vídeo.
La cadena toma el guion (o un artículo, un PDF o una página de Confluence), genera las escenas, añade el avatar-locutor con su voz, monta, coloca los subtítulos, trocea los shorts y publica. Cada paso se configura en el panel.
-
01
El guion — con sus palabras o con un documento Puede escribir el guion a mano, cargar un PDF o señalar un artículo en Confluence — la plataforma lo divide por escenas y propone los planos. Después lo ajusta en el panel.
-
02
Avatar del locutor — con su voz Avatares listos o un avatar «como su director de RR. HH.» — a partir de una grabación de vídeo de 5 minutos. La voz del locutor se clona con una grabación de 3 minutos. El lipsync funciona en cualquier idioma.
-
03
Montaje automático con escenas y b-roll La plataforma selecciona por sí sola el b-roll de su archivo (o lo genera con AiST Image), añade transiciones, música, rótulos con las tesis clave y el logo. El resultado es un vídeo terminado — no un «busto parlante».
-
04
Directo — al LMS, a la plataforma de vídeo o al feed El vídeo se trocea automáticamente en shorts verticales con subtítulos, se dobla a los idiomas necesarios y se publica en el LMS, en Rutube/Kinescope y en las redes sociales — mediante conectores listos.
No «simplemente Sora». La cadena completa de producción de vídeo.
La generación es solo el 25% de la tarea. Además hacen falta: montaje, avatares, voz, subtítulos, localización, troceado, branding y publicación. Nosotros lo tenemos todo en un solo panel y a través de una sola API.
Text-to-video
Guion → escenas terminadas en 1080p/4K. Hasta 60 segundos por pasada; los vídeos largos, por empalme.
Image-to-video
Imagen estática → escena animada. La ficha de producto gira, el render del interior cobra vida, el retrato parpadea.
Avatares Ai + lipsync
Avatares listos o un avatar «como su director de RR. HH.». El lipsync funciona en cualquier idioma. Emociones, gestos faciales, ademanes.
Clon de voz del locutor
3 minutos de grabación — y su locutor habla en más de 30 idiomas. Se conservan el timbre, la entonación y el carácter.
Montaje automático
Empalme de escenas, transiciones, ritmo, música según el ambiente, rótulos con las tesis clave — automáticamente.
Troceado automático en shorts
Un webinar largo → 20 clips verticales con encuadre sobre el ponente y un «gancho» en el primer segundo.
Subtítulos en más de 30 idiomas
Subtítulos automáticos desde ASR con códigos de tiempo por palabra. Rótulos estilizados según la marca. SRT/VTT.
Doblaje y relocución
El mismo vídeo en 30 idiomas con lipsync. Una producción — 30 versiones locales. Localización 100 veces más barata.
Upscaling y restauración
Grabaciones corporativas antiguas de 480p → 4K sin pérdidas. Corrección de color, reducción de ruido, restauración de rostros.
Eliminación y sustitución de fondo
El ponente sobre un fondo corporativo sin croma. Eliminación de objetos del plano, cambio de localización en un clic.
Plantillas y branding
Logo, rótulos, tercios inferiores, cabecera, packshot — según la plantilla de marca. Se compone automáticamente.
Catálogo de modelos
FLUX-Video, Kling, Hunyuan, Sora-like, su self-host. A través de AiST Gateway — el modelo adecuado para cada tarea.
Un solo motor — para formación, publicidad, redes sociales, e-commerce y TV corporativa.
No estamos atados a un modelo ni a un formato. Para cada caso — el modelo, la plantilla y el conector adecuados a la plataforma necesaria. El creador de contenidos no piensa «cómo hacerlo» — piensa «de qué trata el vídeo».
// tipos de vídeo
// formatos
// modelos & voces
// plataformas de vídeo
// lms & formación
// redes sociales & publicidad
El vídeo pasa de ser «un proyecto de un trimestre» a «una tarea rutinaria de una mañana».
Las 50 lecciones de un curso formativo — en una semana, con un solo diseñador instruccional y sin equipo. 200 shorts para redes sociales a partir de un webinar de una hora — en una hora. Fichas de 5000 productos con demostración animada — en una noche. La localización del curso insignia a 5 idiomas — en un día, no en un trimestre y un presupuesto millonario.
Editor web: el guion a la izquierda, la vista previa a la derecha, la línea de tiempo abajo. Nada de Premiere, nada de After Effects.
1C envía la línea del producto o de la lección — y recibe de vuelta el vídeo terminado con avatar, locución y rótulos. En 5 minutos está en el escaparate o en el LMS.
Carga un webinar de una hora — y obtiene 20 shorts verticales con subtítulos, rótulos y un «gancho» en el primer segundo. Listos para publicar.
De la universidad corporativa al feed de las redes sociales.
Video es la infraestructura de producción. Cada departamento encuentra su caso: formación, marketing, e-commerce, RR. HH., medios, producto. Un motor, distintos presets.
Un curso corporativo en una semana, no en un año
El diseñador instruccional carga el PDF del programa — y obtiene 50 lecciones con locutores, montaje, subtítulos y tests. El curso en 5 idiomas — en paralelo.
Creatividades publicitarias para tests A/B
20 variantes de un vídeo de 15 segundos con distintas tesis y creatividades — en una hora. Ya.Direct y VK Ads las aceptan, el marketing de performance las testea y el presupuesto de producción queda liberado.
Fichas en vídeo para más de 1000 productos
Cada producto con foto 360° y un breve vídeo de presentación que se genera a partir de la ficha del producto en 1C. La conversión de una ficha con vídeo es un 30–80% mayor que sin él.
Shorts a partir de webinars y entrevistas
Un webinar de una hora → 20 clips verticales con encuadre sobre el ponente, subtítulos y un «gancho» en el primer segundo. SMM alimenta a diario los algoritmos de Reels/Shorts/Clips.
Noticias semanales de la empresa
RR. HH. redacta el resumen de la semana en texto — y obtiene un vídeo de 5 minutos con un avatar-presentador, montaje y gráficos. Los empleados ven la TV corporativa en el portal y en Telegram.
Demos y tutoriales para cada release
Las release notes en Confluence → un tutorial automático con screencast, voz y subtítulos. Cada funcionalidad con su vídeo en la documentación, sin intervención del redactor técnico.
No hace falta «acoplar Sora y programar un editor de montaje». Todo ya está listo.
Un modelo text-to-video «a pelo» es menos de la cuarta parte de la tarea. Además hacen falta: voces, avatares, montaje, subtítulos, plantillas de marca, publicación en el LMS y las redes sociales, un clúster GPU. Nosotros ya lo tenemos todo integrado.
Se activa — no lo construye el equipo de DevOps durante medio año.
AiST Video es un servicio dentro de AiST Platform. No necesita buscar ingenieros de ML para modelos de difusión, desplegar infraestructura GPU, desarrollar un editor de vídeo ni integraciones con el LMS. Cargue 5 minutos de vídeo de su director de RR. HH. — y en un día será el locutor de cualquiera de sus cursos.
«Habíamos planificado el lanzamiento del curso para un trimestre y un gran presupuesto. Lo lanzamos en una semana con un solo diseñador instruccional. La localización a 5 idiomas — en paralelo»
Qué más hay en AiST Platform→El vídeo con su locutor y sus datos — no sale del perímetro.
El avatar Ai de su alto directivo, el clon de voz del director de RR. HH., la demo del nuevo producto, los rostros de los empleados en la TV corporativa — son PII, biometría y secreto comercial. AiST Video funciona on-prem, con auditoría, marcas de agua y moderación.
Perímetro cerrado
- On-prem o AiST BOX en su CPD
- La inferencia GPU — en sus instalaciones, nada sale fuera
- Los avatares y las voces — en su base de datos
- Marca de agua invisible en las generaciones
- Filtros NSFW + brand-safety
- Auditoría de cada generación — en el SIEM
Garantía de estilo
- Plantillas de cabecera, rótulos y tercios inferiores
- Colores, tipografías y logo según el manual de marca
- Voces — solo las aprobadas
- Avatares — solo los oficiales
- Moderación a la salida
- Versionado de plantillas
ROI y presupuesto
- −90% de coste de producción
- −80% de coste de localización
- × 20 de velocidad de publicación de contenido
- Presupuestos GPU por departamento
- Factura transparente en rublos
- Licencia por minutos o por paquete
Lo que suelen preguntar antes de un piloto de Video.
¿Va a quedar «cringe de IA» o bien?
Bien — si se eligen correctamente el modelo y el caso. Los avatares y el lipsync han alcanzado en el último año un nivel en el que el espectador no lo nota. La generación text-to-video completa aún se percibe «de IA» en primeros planos de rostros, pero es perfecta para b-roll, abstracciones y demos de producto. La elección del modelo para su caso la hacemos en el piloto.
¿Se puede crear el avatar de nuestro director de RR. HH. / CEO?
Sí. Con una grabación de vídeo de 5 minutos «de medio perfil, con distintas emociones» se entrena un avatar personal. Con una grabación de audio de 3 minutos se clona la voz. El avatar se almacena en su base de datos y su uso queda bajo el rol «aprobado por el responsable de marca».
¿Y qué hay de la localización y el doblaje?
Un vídeo → más de 30 idiomas con lipsync. La voz del locutor se conserva (no es un «TTS robotizado»: su director de RR. HH. habla en uzbeko con su propia voz). El coste de la localización es 100 veces inferior al doblaje de estudio.
¿Cuántas GPU hacen falta?
Para empezar — 1–2 H100 o equivalente: hasta ~200 minutos de vídeo terminado al día. Un vídeo de 30 s — renderizado en 2–4 minutos. Para e-commerce con miles de fichas al día — escalado horizontal. El dimensionamiento lo calculamos para su volumen.
¿Cuánto tarda la puesta en marcha?
El piloto «el diseñador instruccional monta un curso formativo» o «SMM trocea shorts» — 2 semanas hasta producción (incluidos el entrenamiento del avatar y el clon de voz). La cadena completa de e-commerce con integración de 1C y marketplaces — 4–6 semanas.
¿Es un producto independiente o parte de la plataforma?
AiST Video es un servicio dentro de AiST Platform. Puede contratarlo por separado (como Video-API) o directamente con AiST Image para el b-roll, AiST ASR para las transcripciones, RAG para la búsqueda en vídeo, roles y auditoría. Un solo panel, una sola factura.
Envíenos un vídeo del locutor — nuestro gestor le mostrará el avatar y la locución directamente en la reunión.
Solicite una demo: envíe un vídeo breve de su representante y le mostraremos el avatar Ai terminado con su voz y su aspecto directamente en la reunión de demostración.