Llamadas, reuniones y vídeos — a texto con separación por interlocutores.
AiST ASR convierte cualquier voz — llamadas del call center, reuniones, vídeo-formación, entrevistas — en una transcripción de texto precisa con marcas de tiempo, interlocutores y temas clave. Integrado en AiST Platform: conecte su centralita o una carpeta — el resto funciona solo.
- ◉ Diarización: hasta 10 interlocutores
- ≋ Realtime & batch
- ⌬ Precisión WER ~ 5–8 %
- ⛯ SIP / telefonía «listo para usar»
- ⛨ 152-ФЗ · on-prem · máscaras PII
Miles de horas de llamadas y reuniones — y cero datos con los que trabajar.
El call center graba el 100 % de las llamadas — escucha el 1 %. Las reuniones de Teams «se pierden en el vacío». Los vídeo-cursos están ahí y no se pueden buscar. La voz sigue siendo el principal canal de datos perdido de la empresa.
Se escucha el 1 % de las llamadas, se sanciona por el 1 % de los errores
El supervisor del call center no llega a escucharlo todo — toma una muestra aleatoria. Los problemas reales (mal trato, promesas, fugas de información) pasan desapercibidos, y los operadores «buenos» reciben sanciones por un fallo puntual.
Hora y media de reunión — y nadie recuerda qué se decidió
Las reuniones en Teams/Zoom pasan — y ya está. Alguien tomó notas, alguien no. Una semana después surge la pregunta «¿qué decidimos allí?» — y la respuesta se reconstruye de memoria.
200 horas de vídeo corporativo imposibles de buscar
Grabaciones de ponencias internas, vídeo-instrucciones, cursos de formación — están en Kinescope y el portal corporativo sin búsqueda. «Por el minuto 7 hablaban de…» — nadie lo encontrará.
Del audio «en bruto» — al acta etiquetada en el CRM. Sin intervención humana.
El pipeline recoge el audio de cualquier fuente, lo limpia, lo reconoce, lo separa por interlocutores, entiende emociones y temas — y deposita el resultado allí donde trabajan sus empleados: en el CRM, BI, la base de conocimiento, el panel del contact center.
-
01
La fuente se conecta una sola vez y para siempre Troncal SIP a la centralita, bot en Teams/Zoom, hot-folder con grabaciones, bucket S3 con vídeos. Tras la configuración, el sistema recoge el audio por sí solo.
-
02
Reconocimiento + diarización en una sola pasada El VAD elimina las pausas, el filtro de ruido — el fondo. El modelo ASR entrega texto con marcas de tiempo por palabra. La diarización determina dónde habla el cliente y dónde el operador — incluso sin separación de canales.
-
03
El NLU añade significado sobre el texto Tono de cada intervención, temas de la conversación, entidades clave (número de pedido, nombre, importe), cumplimiento del guion, promesas y reclamaciones — automáticamente.
-
04
El resultado — allí donde trabajan sus empleados La llamada llega a la ficha de la operación en el CRM, el acta de la reunión — a Confluence y las tareas a Jira, la tendencia de las quejas — al panel del directivo.
No es «simplemente Whisper». Un ASR industrial para tareas empresariales.
Modelos listos para telefonía (8 kHz con ruido), para videoconferencias, para grabaciones de medios. Diarización, emociones, temas, checklists, subtítulos — todo en un motor, todo a través de una sola API.
Precisión WER 0.05–0.08
Telefonía de 8 kHz con ruido, hasta 100 términos especializados. Varios idiomas y su mezcla.
Diarización de interlocutores
Hasta 10 personas en una grabación. Funciona incluso en mono. IDs estables durante toda la grabación.
Realtime < 500 ms
Transcripción en streaming para llamadas en directo, apuntador para el operador, subtítulos en tiempo real en reuniones.
Temas y tono
Etiquetas automáticas: «queja», «devolución», «consulta de precio». Emoción de la intervención — irritado/neutro/amable.
Checklist del guion
«¿Saludó?», «¿Dijo su nombre?», «¿Comunicó el precio?». Cada llamada etiquetada — el supervisor lo ve todo.
Entidades y hechos
Número de pedido, fecha, importe, nombre, dirección — se extraen de la voz y rellenan la ficha del cliente.
Diccionario propio
Nombres de productos, nombres de empleados, abreviaturas. Cargue la lista — el modelo aprende a escribirlos correctamente.
Enmascaramiento de PII
Números de tarjeta, pasaporte, identificadores en la voz — se distorsionan automáticamente en el audio y se enmascaran en el texto.
Marcas de tiempo por palabra
Cada palabra — con su propio tiempo. Un clic en el texto — salto en el audio al mismo segundo.
Subtítulos SRT/VTT
Archivos de subtítulos listos para Rutube/Kinescope/el portal corporativo. Pistas multilingües.
Acta automática + tareas
AiST LLM sobre la transcripción elabora el acta: decisiones, responsables, tareas, plazos.
Stream + batch
WebSocket para la llamada en directo, batch para millones de horas de archivo — con los mismos modelos.
Más de 20 conectores: telefonía, conferencias, plataformas de vídeo, archivos.
No hace falta «migrar antes a todos a nuestra centralita». Nos conectamos a lo que ya tiene instalado — Asterisk, Mango, МТС Линк, Контур.Толк, el portal corporativo. Los archivos antiguos — a través de S3 y carpetas compartidas.
// telefonía / sip
// videoconferencias
// plataformas de vídeo
// archivos / repositorios
// crm & contact centers
// live & api
Audio — a la entrada. Texto etiquetado en el CRM — a la salida.
Para cada fuente — un conector listo que recoge la grabación tras la llamada o la reunión y entrega el resultado allí donde trabajan sus empleados. La transcripción aparece en la ficha del cliente, en el acta de la reunión, en el panel del supervisor — y no «en un buscador aparte al que nadie entra».
La llamada aún está en curso — y el texto ya aparece en la pantalla del operador. El apuntador sugiere el guion y respuestas de la base de conocimiento.
Al terminar, la grabación se recoge, se transcribe, se etiqueta — 30 segundos después está en la ficha del cliente.
«Recupere todas las llamadas de los últimos 3 años y muestre las tendencias de rechazos» — millones de horas en una noche.
Un solo motor — control de calidad, actas, subtítulos, entrada por voz.
El ASR es infraestructura para una decena de escenarios a la vez. El call center obtiene control de calidad, ventas — la transcripción de llamadas en el CRM, RR. HH. — actas de reuniones, los medios — la transcripción de entrevistas.
Control de calidad del 100 % de las llamadas
Cada llamada etiquetada según el guion: tono, temas, promesas al cliente. Las anomalías — al supervisor. Solo hace falta escuchar manualmente las dudosas. Un contact center de 200 operadores se controla con una sola persona.
Transcripción de llamadas en la ficha de la operación
El comercial no pierde 20 minutos en «registrarlo en el CRM» — la conversación se guarda sola en la ficha con etiquetas de tema y el siguiente paso. El jefe de ventas ve el panorama real, y no «todo ok» en los comentarios.
Acta automática de reuniones con tareas
La reunión en Teams/МТС Линк termina — 2 minutos después el acta está en Confluence: decisiones, responsables, plazos. Las tareas van automáticamente a Jira. Nadie toma notas a mano.
Búsqueda en la videoteca y subtítulos
Grabaciones de formaciones internas y vídeo-cursos — con búsqueda por texto y salto por marca de tiempo. El empleado encuentra «dónde hablan de tramitar un viaje de trabajo» en 5 segundos, en lugar de ver una hora de grabación.
Transcripción de vistas y declaraciones
La grabación de audio de la vista — a texto con interlocutores y citas para el expediente. Búsqueda en las declaraciones, exportación para la demanda. El jurista ahorra días en cada procedimiento.
Transcripción de entrevistas y pódcasts
El periodista graba la entrevista — en el editor ya está el texto etiquetado. Marketing recibe el texto completo de los webinars para newsletters y artículos. La producción de contenido se acelera de 5 a 10 veces.
No hace falta «acoplar Whisper». Todo está ya acoplado.
Un modelo ASR «desnudo» es menos de la mitad de la tarea. Después hacen falta: receptores SIP, diarización, NLU encima, etiquetado del guion, exportación al CRM, panel para el supervisor, enmascaramiento PCI-DSS. Nosotros ya lo tenemos todo montado.
Se activa — no se integra durante meses.
AiST ASR es un servicio dentro de AiST Platform. No necesita ingenieros de ML, infraestructura GPU aparte, desarrollo de integraciones con la centralita y el CRM, ni paneles desde cero. Conecte el troncal SIP — un día después cada llamada está etiquetada y en la ficha del cliente.
«El control de calidad del call center lo hacía un departamento de 6 personas — quedó una. La cobertura pasó del 1 % al 100 %»
Qué más hay en AiST Platform→La voz del cliente son datos personales. Por eso el ASR vive en su perímetro.
Una llamada contiene PII (nombre, teléfono, pasaporte), PCI (cuando se dicta una tarjeta) y secreto comercial. AiST ASR funciona on-prem, enmascara lo sensible en la entrada y registra cada petición.
Perímetro cerrado
- On-prem o AiST BOX en su CPD
- La inferencia GPU — en sus instalaciones, nada sale fuera
- Enmascaramiento PII / PCI-DSS al vuelo
- Distorsión de números de tarjeta en el audio
- RBAC: las grabaciones solo las ve el propietario del grupo
- Auditoría de cada petición en el SIEM
ROI y operativa
- −85 % de tiempo de los supervisores del CC
- +15 % de conversión de ventas gracias al análisis de llamadas
- −30 % del tiempo de los comerciales registrando en el CRM
- Licencia por horas o por paquete
- Caché y deduplicación: menor factura de inferencia
- Costes transparentes
Integraciones y gestión
- Más de 20 conectores: telefonía / reuniones / vídeo
- WebSocket / SIPREC / API HTTP
- Diccionario propio, reglas, checklists
- Pruebas A/B de modelos y prompts
- SLA del 99,5 %, escalado horizontal
- Streaming < 500 ms listo para usar
Lo que suelen preguntar antes de un piloto de ASR.
¿Cuál es la precisión real en telefonía?
En telefonía «normal» de 8 kHz con ruido, WER ~ 0.05–0.08; en sonido de estudio — 0.03–0.05. La terminología (productos, marcas) se incorpora con un diccionario propio — enseñamos al texto a escribir correctamente sus nombres. Le mostramos la precisión con sus propias llamadas en 3 días sobre 100 grabaciones.
¿La diarización funciona en un canal mono?
Sí. Si la grabación es un solo archivo con canales mezclados (caso típico de centralitas antiguas), el modelo identifica hasta 10 interlocutores por la voz. En estéreo (cliente / operador separados), la precisión de la diarización es del 99 %.
¿Cómo es la integración con nuestra centralita?
Conexiones listas vía SIP / SIPREC / WebSocket con Asterisk, FreePBX, Mango Office, MTS Exolve, Sipuni, UIS, Naumen. Para el resto — un receptor SIPREC universal. Las llamadas se recogen en directo o al finalizar — como usted prefiera.
¿Cuánto tarda la puesta en marcha?
Un piloto «llamadas en la ficha del CRM» o «actas de reuniones» — 1–2 semanas hasta producción. Un contact center completo con más de 200 operadores, paneles y checklists — 4–6 semanas. El archivo de 3 años — en paralelo, en modo batch.
¿Y qué pasa con PCI-DSS cuando dictan un número de tarjeta?
El detector de números de tarjeta trabaja a nivel de audio — los dígitos se distorsionan en la grabación o se recortan. En el texto — se enmascaran con XXXX. Compatible con los requisitos PCI-DSS para grabaciones de call centers.
¿Es un producto independiente o parte de la plataforma?
AiST ASR es un servicio dentro de AiST Platform. Puede contratar solo este servicio (como API de ASR), o directamente con el constructor de asistentes, RAG sobre las transcripciones, roles y auditoría. Un solo panel, una sola factura.
Envíenos la grabación de una llamada — nuestro gestor le mostrará la transcripción en vivo.
Reserve una demo: envíe el audio de una llamada o reunión, y nuestro gestor le mostrará en la propia reunión la precisión del reconocimiento con su terminología y sus interlocutores.