Moderación de UGC y detección de contenido sensible en texto, foto, vídeo y voz.
AiST Moderation verifica el contenido a la entrada y a la salida: toxicidad, extremismo, NSFW, deepfake, publicidad de competidores, fugas de PII y tarjetas. Protege redes sociales, marketplaces, el correo corporativo y el call center — automáticamente, según sus políticas.
- ⚠ Texto · foto · vídeo · audio
- ⛨ Enmascaramiento PII / PCI-DSS
- ◉ Detección de contenido Ai & deepfake
- ≋ Realtime + batch
- ⌘ 152-ФЗ · 149-ФЗ · on-prem
Un comentario tóxico — un escándalo. Una fuga de tarjeta — una multa.
El UGC, el correo saliente, el contenido del marketplace: es una cadena de miles de unidades al día. La moderación manual es lenta, cara y aun así deja pasar contenido. Un solo fallo cuesta reputación, una multa legal o una fuga de datos de clientes.
Los moderadores no dan abasto, la toxicidad se filtra
Al marketplace o a la red social llegan 50 000 anuncios y comentarios al día. Un equipo de 15 moderadores cubre el 15%. El resto queda a la suerte. Un post escandaloso se convierte en la noticia del día en los canales de Telegram.
Las fugas de PII y tarjetas cuestan millones
Un empleado adjunta a un correo al cliente un archivo con datos de pasaporte. Un operador del call center dicta un número de tarjeta que queda grabado en la llamada. Un gerente envía por Telegram una lista de precios con secretos comerciales. Cada caso es una infracción de la 152-ФЗ.
¿Contenido en el estilo de la marca? — no, es Ai y azar
Los empleados publican en nombre de la marca cualquier cosa. Marketing satura el feed con imágenes de Midjourney «fuera de estilo». Los contratistas publican textos de Ai con alucinaciones. Controlarlo a mano es inviable.
El contenido llega → se clasifica → sale al público, pasa a revisión o va a la papelera.
La cadena acepta cualquier contenido (texto, foto, vídeo, audio, archivo), lo procesa en paralelo con más de 20 clasificadores y sus reglas personalizadas, emite un veredicto con probabilidades de scoring y lo enruta: aprobación automática, bloqueo automático o revisión humana.
-
01
El contenido llega desde cualquier origen REST/Webhook en la fase pre-publish, bus Kafka para el flujo masivo, pasarela de correo para DLP, interceptación de mensajes en mensajería corporativa, grabación de llamadas del call center.
-
02
Más de 20 clasificadores en paralelo Toxicidad, extremismo, NSFW, deepfake, publicidad de competidores, infracciones de la 149-ФЗ, etiquetado de agentes extranjeros, PII, PCI, secreto comercial. Cada uno con su scoring 0..1, todo se combina.
-
03
Veredicto según sus políticas «Si NSFW > 0.85 — bloqueo; si 0.4–0.85 — revisión», «si el correo contiene un NIF y el destinatario está fuera del dominio — bloqueo». Constructor de reglas sin código.
-
04
Acción y auditoría — automáticas El contenido sale al público, va a la papelera o entra en la cola del moderador con prioridad. Cada decisión queda en el log de auditoría y en el SIEM. El moderador hace clic en «de acuerdo» — y el modelo se reentrena.
Más de 20 clasificadores — para todo lo que importa al negocio y a Seguridad.
No un «filtro Ai» universal, sino un conjunto de modelos especializados. Cada uno conoce con precisión su clase. Todos trabajan en paralelo y ofrecen un scoring transparente por categoría.
Toxicidad & insultos
Odio, amenazas, lenguaje soez, humillaciones por rasgos. ru/en, jerga, palabrotas camufladas.
149-ФЗ & extremismo
Contenido prohibido, simbología, agentes extranjeros, publicidad de lo prohibido por la legislación rusa.
NSFW & violencia
Erotismo, violencia, armas, drogas, sangre. Modelos vision para foto y vídeo.
Deepfake & contenido Ai
Vídeos deepfake, rostros generados por FLUX/SDXL, textos de ChatGPT/Claude.
PII / datos personales
Pasaporte, СНИЛС, ИНН, ОГРН, teléfono, e-mail, dirección. En texto, foto (OCR) y voz (ASR).
PCI-DSS / números de tarjeta
Tarjetas en texto, en grabaciones de llamadas, en documentos escaneados. Algoritmo de Luhn + máscara.
Secreto comercial
Listas de precios, contratos, bases de clientes. Búsqueda por plantillas y marcadores de sus documentos.
Spam / phishing / estafas
Patrones de fraude, contactos fuera de la plataforma, enlaces a dominios de phishing.
Publicidad de competidores
Logos, menciones, publicidad encubierta en UGC. La lista negra de marcas es la suya propia.
Derechos de autor
Perceptual-hash para foto y vídeo, búsqueda en su base de activos aprobados.
Contenido por edades
Restricciones de edad 18+/16+/12+ según la UEEA, etiquetado de contenido, age-gate.
Realtime + batch
API ~150 ms por unidad, procesamiento batch de millones de unidades por noche sobre archivos históricos.
Cualquier contenido — cualquier canal. Un solo motor — todos los puntos de entrada.
UGC del marketplace, anuncios, reseñas, comentarios, correo saliente, chats en mensajería corporativa, llamadas del call center, documentos antes de su publicación. En todas partes — la misma política, el mismo scoring, la misma auditoría.
// tipos de contenido
// formatos
// canales de entrada
// legislación rusa
// sectores & plataformas
// acciones según el veredicto
Un motor — un único conjunto de políticas. El contenido se verifica igual en todas partes.
Antes: un moderador para los comentarios, antispam para el correo, un proxy DLP para los documentos, un equipo aparte para las llamadas del call center. Cada uno con reglas propias que se contradecían. Ahora — una política, un diccionario, una auditoría y distintos puntos de entrada.
El UGC se verifica antes de publicarse. Invisible para el usuario — simplemente su «post publicado» aparece en 0.2 segundos.
El archivo de comentarios, conversaciones o documentos se procesa por lotes. Las anomalías y las infracciones detectadas van al moderador.
Interceptación de correos y adjuntos antes del envío. Bloqueo de fugas de PII, tarjetas, contratos y bases de datos. Alerta al responsable de Seguridad.
De la moderación de un marketplace al DLP corporativo.
Moderation es la infraestructura del «filtro». Cada departamento encuentra su caso: plataformas UGC, Seguridad, marketing, soporte, medios. Un motor, distintas políticas y canales.
Moderación pre-publish de anuncios
Antes de publicarse, cada anuncio se verifica: productos prohibidos, esquemas fraudulentos, contactos fuera de la plataforma, rostros de personas sin consentimiento. El 96% sale al público automáticamente en 0.2 s; el resto va al moderador con una explicación.
Moderación de comentarios en tiempo real
Cada comentario recibe un veredicto en 150 ms: aprobación, ocultación, baneo. Odio, política, publicidad de competidores, spam, enlaces de phishing — se bloquean antes de que los vea un solo usuario.
Protección contra fugas de PII por correo
La pasarela de correo escanea los mensajes salientes. Si el correo contiene un pasaporte, una tarjeta, NIF de clientes o una exportación del CRM — bloqueo antes del envío, alerta al responsable de Seguridad y ticket en Jira. Un 100% menos de fugas según la 152-ФЗ.
Control de lo que dicen los operadores
Grabación de la llamada mediante AiST ASR → moderación de la transcripción: descortesía, promesas de descuentos sin autorización, fuga de PII, «dícteme ahora su tarjeta». Alerta al supervisor por cada incidente.
Verificación del contenido antes de su publicación
Cada artículo pasa una revisión: agentes extranjeros sin etiquetar, extremismo, noticias falsas, verificación de hechos mediante RAG. El editor ve las alertas antes de publicar, no tras una queja del regulador.
KYC y detección de deepfake
El selfie de onboarding o la videoverificación se analiza en busca de deepfake, montaje o máscara. Los documentos, en busca de sellos y timbres falsificados. Un 80% menos de solicitudes fraudulentas.
No hace falta montar «su propio CONTROL». Todo ya está configurado.
Un clasificador «a pelo» es menos de la cuarta parte de la tarea. Además hacen falta: más de 20 modelos para distintas categorías, un constructor de políticas, pasarelas (correo, Kafka, SIP), una cola de moderador con prioridades, dashboards, log de auditoría en el SIEM y reentrenamiento. Nosotros ya lo tenemos todo montado.
Se activa — no lo construye el equipo de Seguridad durante un año.
AiST Moderation es un servicio dentro de AiST Platform. No necesita buscar ingenieros de ML, desarrollar la UI del moderador, desplegar infraestructura GPU ni integrarse con cada sistema por separado. Conecte un Webhook desde su plataforma — y en una hora comienza la moderación según sus políticas.
«15 moderadores revisaban el 15% del flujo y aun así nos llevábamos escándalos. Ahora 3 moderadores revisan lo dudoso (4%) y el resto es automático. Llevamos seis meses sin escándalos»
Qué más hay en AiST Platform→Al responsable de Seguridad le encanta este servicio: todo conforme a la ley, todo auditado.
La moderación controla exactamente aquello por lo que hay multas y demandas: datos personales, extremismo, infracciones de derechos de autor, fugas. Por eso AiST Moderation es on-prem, auditado y con decisiones explicables.
Perímetro cerrado
- On-prem o AiST BOX en su CPD
- El contenido no sale del perímetro
- La inferencia GPU — en sus instalaciones
- Exportación al SIEM de cada decisión
- Protección frente a ataques adversariales
- RBAC: los moderadores ven sus propias colas
Cumplimiento normativo
- 152-ФЗ — la PII dentro de su perímetro
- 149-ФЗ — contenido prohibido
- 114-ФЗ — extremismo
- 436-ФЗ — etiquetado por edades
- Agentes extranjeros — etiquetado automático
- Informes listos para el regulador
ROI y operaciones
- −85% de plantilla de moderación
- 96% de las decisiones — autónomas
- 0 fugas de PII gracias al DLP
- 0 multas por la 152-ФЗ y del regulador
- Factura transparente en rublos
- Licencia por unidades o por paquete
Lo que suelen preguntar antes de un piloto de Moderation.
¿Los modelos detectan realmente la jerga rusa y las palabrotas camufladas?
Sí. Los modelos están entrenados con corpus en ruso teniendo en cuenta la jerga, las distorsiones (sustituciones de letras por símbolos o cifras) y el enmascaramiento con emojis. Precisión en toxicidad: 0.92–0.95. Se reentrenan continuamente con las correcciones de su moderador.
¿Qué hacer con los falsos positivos?
Todo lo dudoso (scoring 0.3–0.85, umbrales configurables) pasa a la cola del moderador. El moderador hace clic en «de acuerdo / no de acuerdo» — y el modelo se reentrena. Tras un mes de trabajo, la precisión en sus tipos de contenido crece de forma notable.
¿Se pueden añadir reglas personalizadas propias?
Sí. Constructor de políticas sin código: «si el scoring X > Y y hay un NIF y el destinatario está fuera del dominio — bloqueo». Sus propias listas negras de palabras, rostros y dominios. Sus propios perceptual-hash de «imágenes prohibidas» (logotipos de competidores, gráficos aprobados de competidores).
¿De verdad se detecta el deepfake?
Los deepfakes actuales en foto y vídeo — sí, con una precisión de 0.88–0.94 en ataques típicos. Los deepfakes perfectos de un atacante avanzado pueden colarse, por lo que en escenarios KYC recomendamos combinarlo con verificación liveness (parpadeo, giro de cabeza). Los textos generados por Ai de GPT/Claude se detectan con mayor precisión (0.85–0.92).
¿Cuánto tarda la puesta en marcha?
Un piloto de «moderación de un canal» (comentarios, DLP de correo o anuncios) — 1–2 semanas hasta producción. La moderación corporativa completa con todos los canales, políticas y dashboards de Seguridad — 4–6 semanas.
¿Es un producto independiente o parte de la plataforma?
AiST Moderation es un servicio dentro de AiST Platform. Puede contratarlo por separado (como Moderation-API) o directamente con OCR (para documentos), ASR (para llamadas), RAG (para fact-check) y Dialog (para moderar chats al vuelo). Un solo panel, una sola factura, una auditoría unificada.
Envíenos muestras de contenido — nuestro gestor le mostrará la moderación con sus datos.
Solicite una demo: envíe ejemplos de su UGC, correos o anuncios, y nuestro gestor le mostrará la precisión de la clasificación en sus categorías directamente en la reunión.