AiST.Ai
aist.moderation / ugc · pii · dlp · brand-safety

Moderación de UGC y detección de contenido sensible en texto, foto, vídeo y voz.

AiST Moderation verifica el contenido a la entrada y a la salida: toxicidad, extremismo, NSFW, deepfake, publicidad de competidores, fugas de PII y tarjetas. Protege redes sociales, marketplaces, el correo corporativo y el call center — automáticamente, según sus políticas.

  • Texto · foto · vídeo · audio
  • Enmascaramiento PII / PCI-DSS
  • Detección de contenido Ai & deepfake
  • Realtime + batch
  • 152-ФЗ · 149-ФЗ · on-prem
// el problema

Un comentario tóxico — un escándalo. Una fuga de tarjeta — una multa.

El UGC, el correo saliente, el contenido del marketplace: es una cadena de miles de unidades al día. La moderación manual es lenta, cara y aun así deja pasar contenido. Un solo fallo cuesta reputación, una multa legal o una fuga de datos de clientes.

// ugc

Los moderadores no dan abasto, la toxicidad se filtra

Al marketplace o a la red social llegan 50 000 anuncios y comentarios al día. Un equipo de 15 moderadores cubre el 15%. El resto queda a la suerte. Un post escandaloso se convierte en la noticia del día en los canales de Telegram.

La Ai verifica el 100% del contenido en 0.2 s. Lo dudoso (5–10%) va al moderador; lo evidente se resuelve automáticamente.
// dlp / pii

Las fugas de PII y tarjetas cuestan millones

Un empleado adjunta a un correo al cliente un archivo con datos de pasaporte. Un operador del call center dicta un número de tarjeta que queda grabado en la llamada. Un gerente envía por Telegram una lista de precios con secretos comerciales. Cada caso es una infracción de la 152-ФЗ.

Detección de PII en texto, foto y audio. Enmascaramiento automático, bloqueo de adjuntos, alerta a Seguridad antes del envío.
// marca

¿Contenido en el estilo de la marca? — no, es Ai y azar

Los empleados publican en nombre de la marca cualquier cosa. Marketing satura el feed con imágenes de Midjourney «fuera de estilo». Los contratistas publican textos de Ai con alucinaciones. Controlarlo a mano es inviable.

Filtro brand-safety a la salida: conformidad con el tono, detección de contenido Ai, verificación de hechos mediante RAG.
// cómo funciona

El contenido llega → se clasifica → sale al público, pasa a revisión o va a la papelera.

La cadena acepta cualquier contenido (texto, foto, vídeo, audio, archivo), lo procesa en paralelo con más de 20 clasificadores y sus reglas personalizadas, emite un veredicto con probabilidades de scoring y lo enruta: aprobación automática, bloqueo automático o revisión humana.

// L1 · recepción
api HTTP / SDK pre-publish · live
queue Kafka / RabbitMQ flujo masivo
email pasarela de correo dlp en outbound
chat mensajería & call center chats · llamadas
// L2 · clasificación
txt modelos de texto toxicidad · 149-ФЗ
img modelos vision NSFW · violencia · logos
av vídeo + audio deepfake · lenguaje soez
pii PII / PCI / DLP pasaporte · tarjeta · NIF
// L3 · veredicto & acción
policy sus políticas reglas · umbrales
route aprobar / bloquear / revisar enrutamiento
queue cola del moderador web-UI · prioridad
log auditoría + SIEM cada decisión
  • 01
    El contenido llega desde cualquier origen REST/Webhook en la fase pre-publish, bus Kafka para el flujo masivo, pasarela de correo para DLP, interceptación de mensajes en mensajería corporativa, grabación de llamadas del call center.
  • 02
    Más de 20 clasificadores en paralelo Toxicidad, extremismo, NSFW, deepfake, publicidad de competidores, infracciones de la 149-ФЗ, etiquetado de agentes extranjeros, PII, PCI, secreto comercial. Cada uno con su scoring 0..1, todo se combina.
  • 03
    Veredicto según sus políticas «Si NSFW > 0.85 — bloqueo; si 0.4–0.85 — revisión», «si el correo contiene un NIF y el destinatario está fuera del dominio — bloqueo». Constructor de reglas sin código.
  • 04
    Acción y auditoría — automáticas El contenido sale al público, va a la papelera o entra en la cola del moderador con prioridad. Cada decisión queda en el log de auditoría y en el SIEM. El moderador hace clic en «de acuerdo» — y el modelo se reentrena.
// capacidades

Más de 20 clasificadores — para todo lo que importa al negocio y a Seguridad.

No un «filtro Ai» universal, sino un conjunto de modelos especializados. Cada uno conoce con precisión su clase. Todos trabajan en paralelo y ofrecen un scoring transparente por categoría.

Toxicidad & insultos

Odio, amenazas, lenguaje soez, humillaciones por rasgos. ru/en, jerga, palabrotas camufladas.

toxicity

149-ФЗ & extremismo

Contenido prohibido, simbología, agentes extranjeros, publicidad de lo prohibido por la legislación rusa.

ru-compliance

NSFW & violencia

Erotismo, violencia, armas, drogas, sangre. Modelos vision para foto y vídeo.

nsfw · violence

Deepfake & contenido Ai

Vídeos deepfake, rostros generados por FLUX/SDXL, textos de ChatGPT/Claude.

ai-detect

PII / datos personales

Pasaporte, СНИЛС, ИНН, ОГРН, teléfono, e-mail, dirección. En texto, foto (OCR) y voz (ASR).

152-фз

PCI-DSS / números de tarjeta

Tarjetas en texto, en grabaciones de llamadas, en documentos escaneados. Algoritmo de Luhn + máscara.

pci-dss

Secreto comercial

Listas de precios, contratos, bases de clientes. Búsqueda por plantillas y marcadores de sus documentos.

trade-secret

Spam / phishing / estafas

Patrones de fraude, contactos fuera de la plataforma, enlaces a dominios de phishing.

scam · spam

Publicidad de competidores

Logos, menciones, publicidad encubierta en UGC. La lista negra de marcas es la suya propia.

brand-safety
©

Derechos de autor

Perceptual-hash para foto y vídeo, búsqueda en su base de activos aprobados.

copyright · phash

Contenido por edades

Restricciones de edad 18+/16+/12+ según la UEEA, etiquetado de contenido, age-gate.

age-rating

Realtime + batch

API ~150 ms por unidad, procesamiento batch de millones de unidades por noche sobre archivos históricos.

throughput
// qué moderamos y desde dónde

Cualquier contenido — cualquier canal. Un solo motor — todos los puntos de entrada.

UGC del marketplace, anuncios, reseñas, comentarios, correo saliente, chats en mensajería corporativa, llamadas del call center, documentos antes de su publicación. En todas partes — la misma política, el mismo scoring, la misma auditoría.

// tipos de contenido

ComentarioReseñaAnuncioFicha de productoPostMensajeCorreoLlamadaDocumento

// formatos

TextoImagenVídeoAudioPDFDOCXArchivos (.zip)

// canales de entrada

REST APIWebhookKafka / RabbitMQPostfix / RuPostSIPRECrecursos compartidosS3-bucket

// legislación rusa

152-ФЗ149-ФЗ436-ФЗ por edades114-ФЗ extremismoagentes extranjerosetiquetado de publicidad

// sectores & plataformas

MarketplaceRed socialForoTablón de anunciosWikiPortal corporativoMedios

// acciones según el veredicto

AprobarBloquearA revisiónEnmascararOcultarAlerta a SeguridadTicket Jira

Un motor — un único conjunto de políticas. El contenido se verifica igual en todas partes.

Antes: un moderador para los comentarios, antispam para el correo, un proxy DLP para los documentos, un equipo aparte para las llamadas del call center. Cada uno con reglas propias que se contradecían. Ahora — una política, un diccionario, una auditoría y distintos puntos de entrada.

96%autónomo (sin moderador)
~ 0.18 sdecisión media
20+clasificadores
Moderación pre-publish

El UGC se verifica antes de publicarse. Invisible para el usuario — simplemente su «post publicado» aparece en 0.2 segundos.

Escaneo post-publish

El archivo de comentarios, conversaciones o documentos se procesa por lotes. Las anomalías y las infracciones detectadas van al moderador.

DLP / outbound

Interceptación de correos y adjuntos antes del envío. Bloqueo de fugas de PII, tarjetas, contratos y bases de datos. Alerta al responsable de Seguridad.

// qué se construye sobre AiST Moderation

De la moderación de un marketplace al DLP corporativo.

Moderation es la infraestructura del «filtro». Cada departamento encuentra su caso: plataformas UGC, Seguridad, marketing, soporte, medios. Un motor, distintas políticas y canales.

// marketplace

Moderación pre-publish de anuncios

Antes de publicarse, cada anuncio se verifica: productos prohibidos, esquemas fraudulentos, contactos fuera de la plataforma, rostros de personas sin consentimiento. El 96% sale al público automáticamente en 0.2 s; el resto va al moderador con una explicación.

UGCfraudeOCR en fotos
// red social / foro

Moderación de comentarios en tiempo real

Cada comentario recibe un veredicto en 150 ms: aprobación, ocultación, baneo. Odio, política, publicidad de competidores, spam, enlaces de phishing — se bloquean antes de que los vea un solo usuario.

realtime149-ФЗbrand-safety
// seguridad & dlp

Protección contra fugas de PII por correo

La pasarela de correo escanea los mensajes salientes. Si el correo contiene un pasaporte, una tarjeta, NIF de clientes o una exportación del CRM — bloqueo antes del envío, alerta al responsable de Seguridad y ticket en Jira. Un 100% menos de fugas según la 152-ФЗ.

PostfixRuPost152-ФЗ
// call center

Control de lo que dicen los operadores

Grabación de la llamada mediante AiST ASR → moderación de la transcripción: descortesía, promesas de descuentos sin autorización, fuga de PII, «dícteme ahora su tarjeta». Alerta al supervisor por cada incidente.

+ AiST ASRPCI-DSSguion
// medios & contenido

Verificación del contenido antes de su publicación

Cada artículo pasa una revisión: agentes extranjeros sin etiquetar, extremismo, noticias falsas, verificación de hechos mediante RAG. El editor ve las alertas antes de publicar, no tras una queja del regulador.

114-ФЗagentes extranjerosfact-check
// banca & servicios financieros

KYC y detección de deepfake

El selfie de onboarding o la videoverificación se analiza en busca de deepfake, montaje o máscara. Los documentos, en busca de sellos y timbres falsificados. Un 80% menos de solicitudes fraudulentas.

KYCdeepfakeliveness
// ya en la plataforma

No hace falta montar «su propio CONTROL». Todo ya está configurado.

Un clasificador «a pelo» es menos de la cuarta parte de la tarea. Además hacen falta: más de 20 modelos para distintas categorías, un constructor de políticas, pasarelas (correo, Kafka, SIP), una cola de moderador con prioridades, dashboards, log de auditoría en el SIEM y reentrenamiento. Nosotros ya lo tenemos todo montado.

Se activa — no lo construye el equipo de Seguridad durante un año.

AiST Moderation es un servicio dentro de AiST Platform. No necesita buscar ingenieros de ML, desarrollar la UI del moderador, desplegar infraestructura GPU ni integrarse con cada sistema por separado. Conecte un Webhook desde su plataforma — y en una hora comienza la moderación según sus políticas.

«15 moderadores revisaban el 15% del flujo y aun así nos llevábamos escándalos. Ahora 3 moderadores revisan lo dudoso (4%) y el resto es automático. Llevamos seis meses sin escándalos»

Qué más hay en AiST Platform
Más de 20 clasificadorestexto · foto · vídeo · audio
listo
PII / PCI / DLPpasaporte · tarjeta · NIF · base de datos
listo
Detección de deepfake + contenido Aifoto · vídeo · texto
listo
Constructor de políticasreglas · umbrales · acciones
listo
UI del moderador + colaprioridades · atajos · reentrenamiento
listo
Pasarelas de entradaAPI · Kafka · email · SIPREC · S3
listo
Integraciones con RAG / OCR / ASRsobre cualquier contenido
listo
Auditoría + SIEMcada decisión — en el log
listo
// control corporativo

Al responsable de Seguridad le encanta este servicio: todo conforme a la ley, todo auditado.

La moderación controla exactamente aquello por lo que hay multas y demandas: datos personales, extremismo, infracciones de derechos de autor, fugas. Por eso AiST Moderation es on-prem, auditado y con decisiones explicables.

// para el CISO

Perímetro cerrado

  • On-prem o AiST BOX en su CPD
  • El contenido no sale del perímetro
  • La inferencia GPU — en sus instalaciones
  • Exportación al SIEM de cada decisión
  • Protección frente a ataques adversariales
  • RBAC: los moderadores ven sus propias colas
// para el departamento jurídico

Cumplimiento normativo

  • 152-ФЗ — la PII dentro de su perímetro
  • 149-ФЗ — contenido prohibido
  • 114-ФЗ — extremismo
  • 436-ФЗ — etiquetado por edades
  • Agentes extranjeros — etiquetado automático
  • Informes listos para el regulador
// para el CFO

ROI y operaciones

  • −85% de plantilla de moderación
  • 96% de las decisiones — autónomas
  • 0 fugas de PII gracias al DLP
  • 0 multas por la 152-ФЗ y del regulador
  • Factura transparente en rublos
  • Licencia por unidades o por paquete
// preguntas frecuentes

Lo que suelen preguntar antes de un piloto de Moderation.

¿Los modelos detectan realmente la jerga rusa y las palabrotas camufladas?

Sí. Los modelos están entrenados con corpus en ruso teniendo en cuenta la jerga, las distorsiones (sustituciones de letras por símbolos o cifras) y el enmascaramiento con emojis. Precisión en toxicidad: 0.92–0.95. Se reentrenan continuamente con las correcciones de su moderador.

¿Qué hacer con los falsos positivos?

Todo lo dudoso (scoring 0.3–0.85, umbrales configurables) pasa a la cola del moderador. El moderador hace clic en «de acuerdo / no de acuerdo» — y el modelo se reentrena. Tras un mes de trabajo, la precisión en sus tipos de contenido crece de forma notable.

¿Se pueden añadir reglas personalizadas propias?

Sí. Constructor de políticas sin código: «si el scoring X > Y y hay un NIF y el destinatario está fuera del dominio — bloqueo». Sus propias listas negras de palabras, rostros y dominios. Sus propios perceptual-hash de «imágenes prohibidas» (logotipos de competidores, gráficos aprobados de competidores).

¿De verdad se detecta el deepfake?

Los deepfakes actuales en foto y vídeo — sí, con una precisión de 0.88–0.94 en ataques típicos. Los deepfakes perfectos de un atacante avanzado pueden colarse, por lo que en escenarios KYC recomendamos combinarlo con verificación liveness (parpadeo, giro de cabeza). Los textos generados por Ai de GPT/Claude se detectan con mayor precisión (0.85–0.92).

¿Cuánto tarda la puesta en marcha?

Un piloto de «moderación de un canal» (comentarios, DLP de correo o anuncios) — 1–2 semanas hasta producción. La moderación corporativa completa con todos los canales, políticas y dashboards de Seguridad — 4–6 semanas.

¿Es un producto independiente o parte de la plataforma?

AiST Moderation es un servicio dentro de AiST Platform. Puede contratarlo por separado (como Moderation-API) o directamente con OCR (para documentos), ASR (para llamadas), RAG (para fact-check) y Dialog (para moderar chats al vuelo). Un solo panel, una sola factura, una auditoría unificada.

// next step

Envíenos muestras de contenido — nuestro gestor le mostrará la moderación con sus datos.

Solicite una demo: envíe ejemplos de su UGC, correos o anuncios, y nuestro gestor le mostrará la precisión de la clasificación en sus categorías directamente en la reunión.

// al enviar, usted acepta el tratamiento de sus datos personales