AiST.Ai
aist.video / generation · auto-edit · dubbing · avatars

Vídeo sin rodaje: del guion al vídeo terminado en minutos.

AiST Video monta vídeos formativos, publicitarios y de producto a partir de texto, imágenes y su archivo: avatar Ai del locutor, montaje automático, doblaje, subtítulos, troceado de contenido largo en shorts. Un mismo vídeo — para Reels, Shorts, VK Clips, Dzen y el LMS corporativo, con doblaje a más de 30 idiomas. Sin cámara, sin actor, sin montador. Guion → vídeo en 3–5 minutos en lugar de dos semanas de producción. T&D, marketing y PR lanzan un curso de 50 lecciones en una semana — antes, un año y el presupuesto de un coche.

  • Text-to-video & image-to-video
  • Avatar Ai del locutor + lipsync
  • Doblaje a más de 30 idiomas
  • Troceado automático en Reels / Shorts / VK Clips
  • 152-ФЗ · on-prem · brand-safety
// el problema

El vídeo es el contenido más caro. Y ya no se puede prescindir de él.

El 90% de las redes sociales, el 70% de la formación y la mitad de la publicidad son vídeo. Pero cada pieza supone rodaje, actor, montaje, gráficos, dos semanas y la factura de la productora. El negocio choca con el techo de producción de contenido audiovisual.

// coste

Un vídeo formativo — miles de euros y un mes

Guion, casting del locutor, estudio, montaje, gráficos, correcciones. Un curso corporativo de 50 lecciones se convierte en un año de trabajo y el presupuesto de un coche de gama alta.

Guion → vídeo terminado con avatar, locución y montaje en 5 minutos. Un curso de 50 lecciones — en una semana.
// escala

SMM quiere 30 shorts a la semana

VK Clips, Reels, Shorts — los algoritmos premian a quien publica mucho. Usted tiene webinars e entrevistas largas — pero no hay quien las trocee en 30 clips verticales con subtítulos.

Troceado automático del vídeo largo en shorts verticales con subtítulos y encuadre sobre el ponente. 30 piezas en una hora.
// localización

Lanzamiento en 5 países = 5 producciones

Un curso formativo en 5 idiomas son 5 locutores, 5 estudios, 5 montajes. La localización consume el 80% del presupuesto de un lanzamiento regional.

Doblaje y lipsync a más de 30 idiomas. Un vídeo — 30 versiones locales en una hora, conservando la voz del locutor.
// cómo funciona

Del texto del guion — al vídeo terminado en la plataforma de vídeo.

La cadena toma el guion (o un artículo, un PDF o una página de Confluence), genera las escenas, añade el avatar-locutor con su voz, monta, coloca los subtítulos, trocea los shorts y publica. Cada paso se configura en el panel.

// L1 · entrada
script texto / guion + asistente de redacción
doc artículo / PDF / Confluence guion automático
media foto / b-roll su archivo + AiST Image
long vídeo largo / grabación webinar · entrevista
// L2 · montaje
scenes generación de escenas FLUX-Video · Kling · Sora-like
avatar avatar Ai del locutor lipsync · gestos faciales
tts locución con su voz clon de voz · ru/en
edit montaje automático empalmes · transiciones · b-roll
// L3 · exportación
subs subtítulos SRT/VTT más de 30 idiomas
shorts troceado en shorts 9:16 + encuadre al rostro
brand logo + rótulos + cta plantilla de marca
publish al LMS / redes / DAM Rutube · VK · Kinescope
  • 01
    El guion — con sus palabras o con un documento Puede escribir el guion a mano, cargar un PDF o señalar un artículo en Confluence — la plataforma lo divide por escenas y propone los planos. Después lo ajusta en el panel.
  • 02
    Avatar del locutor — con su voz Avatares listos o un avatar «como su director de RR. HH.» — a partir de una grabación de vídeo de 5 minutos. La voz del locutor se clona con una grabación de 3 minutos. El lipsync funciona en cualquier idioma.
  • 03
    Montaje automático con escenas y b-roll La plataforma selecciona por sí sola el b-roll de su archivo (o lo genera con AiST Image), añade transiciones, música, rótulos con las tesis clave y el logo. El resultado es un vídeo terminado — no un «busto parlante».
  • 04
    Directo — al LMS, a la plataforma de vídeo o al feed El vídeo se trocea automáticamente en shorts verticales con subtítulos, se dobla a los idiomas necesarios y se publica en el LMS, en Rutube/Kinescope y en las redes sociales — mediante conectores listos.
// capacidades

No «simplemente Sora». La cadena completa de producción de vídeo.

La generación es solo el 25% de la tarea. Además hacen falta: montaje, avatares, voz, subtítulos, localización, troceado, branding y publicación. Nosotros lo tenemos todo en un solo panel y a través de una sola API.

Text-to-video

Guion → escenas terminadas en 1080p/4K. Hasta 60 segundos por pasada; los vídeos largos, por empalme.

generation

Image-to-video

Imagen estática → escena animada. La ficha de producto gira, el render del interior cobra vida, el retrato parpadea.

img2vid

Avatares Ai + lipsync

Avatares listos o un avatar «como su director de RR. HH.». El lipsync funciona en cualquier idioma. Emociones, gestos faciales, ademanes.

avatar · lipsync

Clon de voz del locutor

3 minutos de grabación — y su locutor habla en más de 30 idiomas. Se conservan el timbre, la entonación y el carácter.

voice-clone · tts

Montaje automático

Empalme de escenas, transiciones, ritmo, música según el ambiente, rótulos con las tesis clave — automáticamente.

auto-edit

Troceado automático en shorts

Un webinar largo → 20 clips verticales con encuadre sobre el ponente y un «gancho» en el primer segundo.

clipping · 9:16
A

Subtítulos en más de 30 idiomas

Subtítulos automáticos desde ASR con códigos de tiempo por palabra. Rótulos estilizados según la marca. SRT/VTT.

captions

Doblaje y relocución

El mismo vídeo en 30 idiomas con lipsync. Una producción — 30 versiones locales. Localización 100 veces más barata.

dub · localization

Upscaling y restauración

Grabaciones corporativas antiguas de 480p → 4K sin pérdidas. Corrección de color, reducción de ruido, restauración de rostros.

restore

Eliminación y sustitución de fondo

El ponente sobre un fondo corporativo sin croma. Eliminación de objetos del plano, cambio de localización en un clic.

bg · matting

Plantillas y branding

Logo, rótulos, tercios inferiores, cabecera, packshot — según la plantilla de marca. Se compone automáticamente.

brand · templates

Catálogo de modelos

FLUX-Video, Kling, Hunyuan, Sora-like, su self-host. A través de AiST Gateway — el modelo adecuado para cada tarea.

multi-model
// qué hace y adónde exporta

Un solo motor — para formación, publicidad, redes sociales, e-commerce y TV corporativa.

No estamos atados a un modelo ni a un formato. Para cada caso — el modelo, la plantilla y el conector adecuados a la plataforma necesaria. El creador de contenidos no piensa «cómo hacerlo» — piensa «de qué trata el vídeo».

// tipos de vídeo

FormativoOnboardingPromoFicha de productoDemo de productoNoticias corporativasShortReelsTeaserCaso de éxito

// formatos

16:9 horizontal9:16 vertical1:1 cuadrado4:5 post4K UHD1080pHEVC · H.264 · AV1

// modelos & voces

FLUX-VideoKlingHunyuanWanYandexGPT-VideoSaluteSpeech TTSSileroTTS+ voces personalizadas

// plataformas de vídeo

RutubeKinescopeVK VideoVK ClipsYa.EfirRuTube LiveHLS / RTMP

// lms & formación

iSpring LearnEquioMirapolisWebTutor1C:E-learningSCORM 1.2 / 2004

// redes sociales & publicidad

VK AdsYa.DirectTelegram AdsDzenOKPinterest

El vídeo pasa de ser «un proyecto de un trimestre» a «una tarea rutinaria de una mañana».

Las 50 lecciones de un curso formativo — en una semana, con un solo diseñador instruccional y sin equipo. 200 shorts para redes sociales a partir de un webinar de una hora — en una hora. Fichas de 5000 productos con demostración animada — en una noche. La localización del curso insignia a 5 idiomas — en un día, no en un trimestre y un presupuesto millonario.

× 20velocidad de producción
−90%coste por vídeo
~ 3 minrenderizado de 1 vídeo de 30 s
Panel del creador de contenidos

Editor web: el guion a la izquierda, la vista previa a la derecha, la línea de tiempo abajo. Nada de Premiere, nada de After Effects.

API para e-commerce y LMS

1C envía la línea del producto o de la lección — y recibe de vuelta el vídeo terminado con avatar, locución y rótulos. En 5 minutos está en el escaparate o en el LMS.

Cadena para redes sociales

Carga un webinar de una hora — y obtiene 20 shorts verticales con subtítulos, rótulos y un «gancho» en el primer segundo. Listos para publicar.

// qué se construye sobre AiST Video

De la universidad corporativa al feed de las redes sociales.

Video es la infraestructura de producción. Cada departamento encuentra su caso: formación, marketing, e-commerce, RR. HH., medios, producto. Un motor, distintos presets.

// formación

Un curso corporativo en una semana, no en un año

El diseñador instruccional carga el PDF del programa — y obtiene 50 lecciones con locutores, montaje, subtítulos y tests. El curso en 5 idiomas — en paralelo.

iSpringSCORMavatares
// marketing

Creatividades publicitarias para tests A/B

20 variantes de un vídeo de 15 segundos con distintas tesis y creatividades — en una hora. Ya.Direct y VK Ads las aceptan, el marketing de performance las testea y el presupuesto de producción queda liberado.

Ya.DirectVK AdsA/B
// e-commerce

Fichas en vídeo para más de 1000 productos

Cada producto con foto 360° y un breve vídeo de presentación que se genera a partir de la ficha del producto en 1C. La conversión de una ficha con vídeo es un 30–80% mayor que sin él.

1C:Comerciomarketplaces360°
// smm & contenido

Shorts a partir de webinars y entrevistas

Un webinar de una hora → 20 clips verticales con encuadre sobre el ponente, subtítulos y un «gancho» en el primer segundo. SMM alimenta a diario los algoritmos de Reels/Shorts/Clips.

VK ClipsTelegram9:16
// tv corporativa

Noticias semanales de la empresa

RR. HH. redacta el resumen de la semana en texto — y obtiene un vídeo de 5 minutos con un avatar-presentador, montaje y gráficos. Los empleados ven la TV corporativa en el portal y en Telegram.

Telegramportalresumen
// producto

Demos y tutoriales para cada release

Las release notes en Confluence → un tutorial automático con screencast, voz y subtítulos. Cada funcionalidad con su vídeo en la documentación, sin intervención del redactor técnico.

Confluencescreencastrelease-notes
// ya en la plataforma

No hace falta «acoplar Sora y programar un editor de montaje». Todo ya está listo.

Un modelo text-to-video «a pelo» es menos de la cuarta parte de la tarea. Además hacen falta: voces, avatares, montaje, subtítulos, plantillas de marca, publicación en el LMS y las redes sociales, un clúster GPU. Nosotros ya lo tenemos todo integrado.

Se activa — no lo construye el equipo de DevOps durante medio año.

AiST Video es un servicio dentro de AiST Platform. No necesita buscar ingenieros de ML para modelos de difusión, desplegar infraestructura GPU, desarrollar un editor de vídeo ni integraciones con el LMS. Cargue 5 minutos de vídeo de su director de RR. HH. — y en un día será el locutor de cualquiera de sus cursos.

«Habíamos planificado el lanzamiento del curso para un trimestre y un gran presupuesto. Lo lanzamos en una semana con un solo diseñador instruccional. La localización a 5 idiomas — en paralelo»

Qué más hay en AiST Platform
Catálogo de modelos de vídeoFLUX-Video · Kling · Hunyuan · self-host
listo
Avatares Ai + lipsynclistos + personalizado con 5 min de vídeo
listo
Clon de voz del locutor3 min de grabación → más de 30 idiomas
listo
Montaje automático + b-rollmediante AiST Image · música · transiciones
listo
Troceado automático en shorts9:16 + encuadre sobre el ponente
listo
A
Subtítulos + doblaje a más de 30 idiomasel lipsync se conserva
listo
Conectores LMS / redes / DAMiSpring · Equio · Rutube · VK · 1C
listo
NSFW + brand-safety + watermarkfiltros + marca de agua visible/invisible
listo
// control corporativo

El vídeo con su locutor y sus datos — no sale del perímetro.

El avatar Ai de su alto directivo, el clon de voz del director de RR. HH., la demo del nuevo producto, los rostros de los empleados en la TV corporativa — son PII, biometría y secreto comercial. AiST Video funciona on-prem, con auditoría, marcas de agua y moderación.

// para el CISO

Perímetro cerrado

  • On-prem o AiST BOX en su CPD
  • La inferencia GPU — en sus instalaciones, nada sale fuera
  • Los avatares y las voces — en su base de datos
  • Marca de agua invisible en las generaciones
  • Filtros NSFW + brand-safety
  • Auditoría de cada generación — en el SIEM
// para la marca

Garantía de estilo

  • Plantillas de cabecera, rótulos y tercios inferiores
  • Colores, tipografías y logo según el manual de marca
  • Voces — solo las aprobadas
  • Avatares — solo los oficiales
  • Moderación a la salida
  • Versionado de plantillas
// para el CFO

ROI y presupuesto

  • −90% de coste de producción
  • −80% de coste de localización
  • × 20 de velocidad de publicación de contenido
  • Presupuestos GPU por departamento
  • Factura transparente en rublos
  • Licencia por minutos o por paquete
// preguntas frecuentes

Lo que suelen preguntar antes de un piloto de Video.

¿Va a quedar «cringe de IA» o bien?

Bien — si se eligen correctamente el modelo y el caso. Los avatares y el lipsync han alcanzado en el último año un nivel en el que el espectador no lo nota. La generación text-to-video completa aún se percibe «de IA» en primeros planos de rostros, pero es perfecta para b-roll, abstracciones y demos de producto. La elección del modelo para su caso la hacemos en el piloto.

¿Se puede crear el avatar de nuestro director de RR. HH. / CEO?

Sí. Con una grabación de vídeo de 5 minutos «de medio perfil, con distintas emociones» se entrena un avatar personal. Con una grabación de audio de 3 minutos se clona la voz. El avatar se almacena en su base de datos y su uso queda bajo el rol «aprobado por el responsable de marca».

¿Y qué hay de la localización y el doblaje?

Un vídeo → más de 30 idiomas con lipsync. La voz del locutor se conserva (no es un «TTS robotizado»: su director de RR. HH. habla en uzbeko con su propia voz). El coste de la localización es 100 veces inferior al doblaje de estudio.

¿Cuántas GPU hacen falta?

Para empezar — 1–2 H100 o equivalente: hasta ~200 minutos de vídeo terminado al día. Un vídeo de 30 s — renderizado en 2–4 minutos. Para e-commerce con miles de fichas al día — escalado horizontal. El dimensionamiento lo calculamos para su volumen.

¿Cuánto tarda la puesta en marcha?

El piloto «el diseñador instruccional monta un curso formativo» o «SMM trocea shorts» — 2 semanas hasta producción (incluidos el entrenamiento del avatar y el clon de voz). La cadena completa de e-commerce con integración de 1C y marketplaces — 4–6 semanas.

¿Es un producto independiente o parte de la plataforma?

AiST Video es un servicio dentro de AiST Platform. Puede contratarlo por separado (como Video-API) o directamente con AiST Image para el b-roll, AiST ASR para las transcripciones, RAG para la búsqueda en vídeo, roles y auditoría. Un solo panel, una sola factura.

// next step

Envíenos un vídeo del locutor — nuestro gestor le mostrará el avatar y la locución directamente en la reunión.

Solicite una demo: envíe un vídeo breve de su representante y le mostraremos el avatar Ai terminado con su voz y su aspecto directamente en la reunión de demostración.

// al enviar, usted acepta el tratamiento de sus datos personales