Grandes modelos de lenguaje propios — API, instancias dedicadas y on-prem.
La gama de LLM propios de AiST: modelos generativos multilingües y de código, multimodales con vision, embeddings, hasta 1M de tokens de contexto. API compatible con OpenAI, instancia dedicada u on-prem en su CPD, fine-tuning para su sector.
- ◯ 4 modelos: Pro · Light · Code · Vision
- ⌬ API compatible con OpenAI
- ≡ Hasta 1M de tokens de contexto
- ⊞ Fine-tuning con sus datos
- ⛨ 152-ФЗ · on-prem · air-gapped
4 modelos propios — para distintas tareas y presupuestos.
No «un modelo universal», sino tamaños y especializaciones diseñados a propósito. Pro para tareas complejas, Light para tareas masivas, Code para desarrollo, Vision para documentos e imágenes. Todos — a través de una sola API.
Pro
Modelo grande para tareas complejas: análisis de contratos, fact-check, agentes, reasoning. Nivel Claude Sonnet / GPT-4o.
Light
Rápido y económico para operaciones masivas: chats, clasificación, etiquetas, resúmenes. ~10 veces más barato que Pro en tareas típicas.
Code
Especializado en desarrollo: generación de código, revisión, tests, debugging, migraciones. Conoce 1С, Python, TS, Go, Rust, SQL, Bash.
Vision
Multimodal: texto + imágenes. Lectura de documentos, esquemas, planos, gráficos, capturas de UI. Integrado con AiST OCR.
Nube, instancia dedicada u on-prem — elija según sus requisitos de seguridad.
Empiece en 5 minutos con la API compartida. Para cargas altas — una instancia dedicada con su propio rate-limit y SLA. Para la 152-ФЗ y un perímetro cerrado — despliegue on-prem en su propio hardware.
Public API
Endpoint multi-tenant compartido. Pay-as-you-go por tokens. Empieza en 5 minutos — obtiene la clave y empieza a lanzar peticiones. Adecuado para prototipos y cargas medias.
Dedicated
Instancia dedicada del modelo en nuestra nube, solo para usted. Throughput garantizado, claves independientes, rate-limit personalizado, SLA 99.9%, baja latencia.
On-prem
Desplegamos los modelos en su CPD, en su hardware. Los datos no abandonan el perímetro. 152-ФЗ. Adecuado para banca, sector público y defensa.
Air-gapped
On-prem sin un solo byte hacia el exterior. Entrega de los modelos en ficheros, actualizaciones en soporte físico. Para infraestructuras críticas.
De la petición en su código — a la respuesta del modelo en 200 ms. A través de una sola API.
El endpoint compatible con OpenAI recibe la petición, el balanceador la enruta al modelo y la región adecuados, la inferencia se ejecuta en nuestro clúster de GPU (o en el suyo para on-prem) y la respuesta vuelve en streaming. Facturación por tokens, transparente.
-
01
Sustituya OpenAI en 5 minutos Cambie el base_url del OpenAI SDK a `https://api.aist.ai/v1` — y todo funciona. La misma interfaz chat.completions, la misma semántica de streaming, el mismo function-calling.
-
02
Balanceador y caché La petición viaja al pool de GPU más cercano; el prompt-cache captura los contextos repetidos (prompts de sistema, contexto RAG) y ahorra hasta un 40% de la factura.
-
03
Function-calling y JSON-mode El modelo invoca sus funciones por sí mismo (tool-use), devuelve JSON estricto según esquema y admite streaming y long-context. Compatible con cualquier framework de agentes.
-
04
Facturación transparente Facturación por tokens, sin riesgos cambiarios. Presupuesto por clave, límite por equipo, bloqueo automático al superarlo. Informes para el CFO — de serie.
No es «otro LLM-API más». Es una gama completa para tareas corporativas.
Streaming, function-calling, JSON-mode, vision, embeddings, fine-tuning, modo batch, prompt-cache. Todo lo necesario para producción — en una sola API, con sus datos, en su perímetro.
API compatible con OpenAI
chat.completions, embeddings, streaming — como en OpenAI. La migración es cambiar el base_url.
Hasta 1M de contexto
aist-llm-pro — 256K; versión ampliada de 1M. Un libro entero o una base de contratos en una sola petición.
Function-calling
El modelo invoca sus API por sí mismo. Tool-calls en paralelo, structured output, JSON-mode.
Vision & multimodal
aist-llm-vision admite hasta 20 imágenes por petición. Documentos, esquemas, gráficos, UI.
Fine-tuning
Reentrenamiento para su dominio — 500–5000 ejemplos y al día siguiente tiene su modelo.
Streaming <200 ms
Stream SSE, TTFT ~200 ms. El usuario ve la respuesta al instante, sin esperar 10 segundos de silencio.
Prompt-cache
Los prompts de sistema repetidos y el contexto RAG se cachean. Un 40% menos en la factura.
Modo batch
Un millón de peticiones por noche — un 50% más barato que las síncronas. Para auditorías y etiquetado.
Guardrails & PII
Filtros de temas, protección contra inyecciones, enmascaramiento de PII a la entrada y a la salida.
Embeddings
aist-embed-ru-v3, 1024-d, hasta 8K tokens. 2 ₽ / 1M. Para RAG y búsqueda.
Panel de uso
Peticiones por clave, tokens, coste, errores, latencia p50/p95/p99.
SDK & integraciones
Python, Node, Go, Rust, .NET, 1С. Compatible con LangChain, LlamaIndex, AutoGen.
Pague solo por lo que usa. Sin riesgos cambiarios.
Precios transparentes por tokens. Descuentos por volumen, modo batch, compra de reserved-capacity. Presupuestos por claves y equipos — para que el CFO no se sobresalte con las facturas.
// tarificación
// modelos
// formas de pago
// sdk & plataformas
// regiones
// integración con los servicios AiST
Precios claros, previsibles, corporativos.
Free-tier para empezar (100 mil tokens en Pro). Descuento por volumen y reserved-capacity. Para clientes corporativos — pago diferido por factura, presupuestos por departamento, contrato único. Sin «sorpresas nocturnas» en la factura.
Pago según el uso real. Empieza con 100K tokens gratuitos y después — según tarifa.
Capacidad reservada con un descuento del 30–50%. Para cargas altas y estables.
Licencia perpetua para desplegar en su perímetro. Sin facturación por tokens: solo paga su propio hardware.
Desde el chat corporativo hasta agentes en producción y modelos custom.
El LLM es la infraestructura de las aplicaciones de IA. Cualquier asistente, agente, buscador, analítica o chat suyo vive sobre un LLM. Es el bloque de construcción básico sin el cual nada funciona.
Un ChatGPT corporativo en su perímetro
Panel web, bot de Telegram, widget en 1С — los empleados conversan con el LLM sin que los datos se filtren a OpenAI. Todas las peticiones — bajo auditoría, por roles, conforme a la 152-ФЗ.
Code-assistant en el IDE
aist-llm-code en VSCode, Cursor, JetBrains mediante la API estándar. Generación, refactorización, tests, revisión de PR. Conoce 1С, Python, TS y su legacy.
Backend para sus funciones de IA
Bajo el capó de su producto — nuestra LLM-API. Asistente de chat, clasificación, resúmenes, generación de descripciones de producto. Una API para todo el producto.
Modelo custom para su sector
Reentrenamiento con 5000 ejemplos de su terminología (medicina, derecho, oil & gas) — y el modelo responde «como su experto». Calidad en su dominio — +20–40%.
Motor para AiST Agent
Bajo nuestros agentes — nuestro propio LLM. Function-calling, JSON-mode, contexto largo, baja latencia. Un agente de 100 pasos termina en 3 minutos.
Procesamiento batch de millones de registros
«Clasifique 10 millones de reseñas», «resuma 1 millón de llamadas», «extraiga los hechos de 500 000 contratos» — la batch-API es un 50% más barata y termina en una noche.
Los modelos propios son la base de todos los demás servicios de AiST.
Cada servicio de AiST utiliza por debajo nuestros propios LLM. RAG genera respuestas con Pro, Dialog conversa con Light, Agent trabaja con Pro y function-calling, OCR usa además Vision. Al contratar AiST LLM — tiene todo el ecosistema al alcance de la mano.
No es solo una API. Es todo el ecosistema AiST.
Puede contratar solo la API y construir lo suyo. O usar directamente los servicios listos sobre el LLM: RAG para buscar en documentos, Agent para tareas autónomas, Dialog para atender a los clientes. Un solo panel, una sola factura, moderación y auditoría unificadas.
«Usábamos GPT-4 a través de VPN, preocupados cada día por la 152-ФЗ. Pasamos a aist-llm-pro — la calidad resultó ser superior, factura transparente, sin VPN ni riesgos jurídicos»
Qué más ofrece AiST Platform→LLM sin VPN y sin riesgos jurídicos: 152-ФЗ y contrato local.
GPT-4 a través de VPN infringe las condiciones de uso de OpenAI y supone un riesgo potencial frente a la 152-ФЗ. AiST LLM resuelve ambos problemas: los modelos en su perímetro, facturación transparente, contrato conforme a la legislación local.
Perímetro cerrado
- On-prem o AiST BOX en su CPD
- Variante air-gapped para infraestructuras críticas
- Las peticiones no salen al extranjero
- RBAC: claves por equipo, scopes por modelo
- Protección contra prompt-injection a la entrada
- Exportación al SIEM de cada petición
Seguridad jurídica
- 152-ФЗ — datos personales en su perímetro
- Contrato bajo jurisdicción local
- Sin VPN ni infracciones de ToS
- Inscrito en el registro nacional de software
- Certificación ФСТЭК (en curso)
- Compatible con СТР-К
Gastos transparentes
- Facturación sin riesgos cambiarios
- Presupuestos por claves y equipos
- Caché y batch — un 40–50% menos en la factura
- Reserved capacity con un descuento del 30–50%
- Pago diferido por factura para B2B
- Documentación de cierre según el estándar local
Lo que suelen preguntarnos antes de migrar desde OpenAI.
¿De verdad la calidad no es inferior a GPT-4 / Claude?
aist-llm-pro está al nivel de Claude Sonnet y GPT-4o, y en varios dominios (textos jurídicos, 1С, informes administrativos) es notablemente más preciso, porque se entrenó teniendo en cuenta esas especificidades. Le mostraremos un benchmark con sus propias tareas en una semana de piloto.
¿Cuánto tarda la migración desde OpenAI?
5 minutos para el código. Cambie el `base_url` del OpenAI SDK a `https://api.aist.ai/v1` y el nombre del modelo a `aist-llm-pro` — y todo funciona. Streaming, function-calling y JSON-mode son compatibles uno a uno.
¿Se puede desplegar el modelo en nuestro CPD?
Sí, la versión on-prem se suministra para Pro, Light, Code, Vision y Embed. Calculamos el dimensionamiento de GPU según su tráfico (normalmente 1–4 H100 para una corporación media). La entrega air-gapped se realiza en soporte físico, sin internet.
¿Realmente se puede afinar el modelo con nuestra terminología?
Sí. Mínimo 500 ejemplos de calidad «pregunta-respuesta» en su estilo. Lo óptimo — 2000–5000. En un día — su modelo custom a través de la misma API. Puede mantener varios modelos fine-tuned a la vez, para distintos equipos.
¿Cuánto costaría con nuestra carga?
Lo calculamos según su perfil de peticiones. Como referencia: una corporación media de 1000 empleados con chat corporativo — ~50–150 mil ₽/mes en Pro con caché. Para cargas altas, la reserved capacity ofrece un 30–50% de descuento. Para air-gapped — licencia única + su propio hardware.
¿Podemos usar solo el LLM o hay que contratar toda la plataforma?
Puede contratar solo la LLM-API — es un producto completo. Pero la verdadera potencia surge en combinación con RAG (búsqueda en documentos), Agent (tareas autónomas), Dialog (widget y mensajería), OCR/ASR/Image. Un solo panel, una sola factura, auditoría unificada.
Obtenga una clave de API en 5 minutos y mida la calidad con sus propias peticiones.
Regístrese — reciba una clave y 100 mil tokens gratuitos en aist-llm-pro. Pruebe sus prompts y compare con GPT-4 o Claude. Decida sobre la base de cifras.