AiST.Ai
aist.llm / own-models · api · dedicated · on-prem

Grandes modelos de lenguaje propios — API, instancias dedicadas y on-prem.

La gama de LLM propios de AiST: modelos generativos multilingües y de código, multimodales con vision, embeddings, hasta 1M de tokens de contexto. API compatible con OpenAI, instancia dedicada u on-prem en su CPD, fine-tuning para su sector.

  • 4 modelos: Pro · Light · Code · Vision
  • API compatible con OpenAI
  • Hasta 1M de tokens de contexto
  • Fine-tuning con sus datos
  • 152-ФЗ · on-prem · air-gapped
// gama de modelos

4 modelos propios — para distintas tareas y presupuestos.

No «un modelo universal», sino tamaños y especializaciones diseñados a propósito. Pro para tareas complejas, Light para tareas masivas, Code para desarrollo, Vision para documentos e imágenes. Todos — a través de una sola API.

flagship aist-llm-pro

Pro

Modelo grande para tareas complejas: análisis de contratos, fact-check, agentes, reasoning. Nivel Claude Sonnet / GPT-4o.

contexto256K
modalidadestext · vision
precio de entrada40 ₽ / 1M
tools / json
aist-llm-light

Light

Rápido y económico para operaciones masivas: chats, clasificación, etiquetas, resúmenes. ~10 veces más barato que Pro en tareas típicas.

contexto128K
velocidad~ 300 tok/s
precio de entrada4 ₽ / 1M
tools / json
aist-llm-code

Code

Especializado en desarrollo: generación de código, revisión, tests, debugging, migraciones. Conoce 1С, Python, TS, Go, Rust, SQL, Bash.

contexto200K
lenguajes de código40+
precio de entrada20 ₽ / 1M
FIM & agentic
aist-llm-vision

Vision

Multimodal: texto + imágenes. Lectura de documentos, esquemas, planos, gráficos, capturas de UI. Integrado con AiST OCR.

contexto128K
img por peticiónhasta 20
precio de entrada30 ₽ / 1M
+ OCRintegrado
+ EMBED aist-embed-ru-v3 · modelo independiente de embeddings para RAG, búsqueda y clustering. 2 ₽ / 1M tokens · vector de 1024 dimensiones · sliding-window hasta 8K.
// opciones de despliegue

Nube, instancia dedicada u on-prem — elija según sus requisitos de seguridad.

Empiece en 5 minutos con la API compartida. Para cargas altas — una instancia dedicada con su propio rate-limit y SLA. Para la 152-ФЗ y un perímetro cerrado — despliegue on-prem en su propio hardware.

Public API

Endpoint multi-tenant compartido. Pay-as-you-go por tokens. Empieza en 5 minutos — obtiene la clave y empieza a lanzar peticiones. Adecuado para prototipos y cargas medias.

tarifapay-as-you-go
SLA99.5%
inicio5 min

Dedicated

Instancia dedicada del modelo en nuestra nube, solo para usted. Throughput garantizado, claves independientes, rate-limit personalizado, SLA 99.9%, baja latencia.

tarifareserved capacity
SLA99.9%
inicio1–3 días

On-prem

Desplegamos los modelos en su CPD, en su hardware. Los datos no abandonan el perímetro. 152-ФЗ. Adecuado para banca, sector público y defensa.

tarifalicencia
hardwaresus GPU
inicio2–4 semanas

Air-gapped

On-prem sin un solo byte hacia el exterior. Entrega de los modelos en ficheros, actualizaciones en soporte físico. Para infraestructuras críticas.

tarifalicencia
internetno necesario
СТР-Кcompatible
// cómo funciona

De la petición en su código — a la respuesta del modelo en 200 ms. A través de una sola API.

El endpoint compatible con OpenAI recibe la petición, el balanceador la enruta al modelo y la región adecuados, la inferencia se ejecuta en nuestro clúster de GPU (o en el suyo para on-prem) y la respuesta vuelve en streaming. Facturación por tokens, transparente.

// L1 · petición
sdk compatible con OpenAI migración en 5 min
auth clave de API Bearer + scope
route selección de modelo pro · light · code · vision
limit rate & budget límite por clave
// L2 · inferencia
balance balanceador region · gpu pool
cache prompt cache −40% en la factura
infer inferencia en GPU vLLM · TensorRT
tools function-calling + JSON-mode
// L3 · respuesta & contabilidad
stream respuesta en streaming SSE · 200 ms TTFT
safety guardrails PII · brand-safety
billing facturación por tokens por clave
audit registro de la petición en el SIEM opcionalmente
  • 01
    Sustituya OpenAI en 5 minutos Cambie el base_url del OpenAI SDK a `https://api.aist.ai/v1` — y todo funciona. La misma interfaz chat.completions, la misma semántica de streaming, el mismo function-calling.
  • 02
    Balanceador y caché La petición viaja al pool de GPU más cercano; el prompt-cache captura los contextos repetidos (prompts de sistema, contexto RAG) y ahorra hasta un 40% de la factura.
  • 03
    Function-calling y JSON-mode El modelo invoca sus funciones por sí mismo (tool-use), devuelve JSON estricto según esquema y admite streaming y long-context. Compatible con cualquier framework de agentes.
  • 04
    Facturación transparente Facturación por tokens, sin riesgos cambiarios. Presupuesto por clave, límite por equipo, bloqueo automático al superarlo. Informes para el CFO — de serie.
// capacidades

No es «otro LLM-API más». Es una gama completa para tareas corporativas.

Streaming, function-calling, JSON-mode, vision, embeddings, fine-tuning, modo batch, prompt-cache. Todo lo necesario para producción — en una sola API, con sus datos, en su perímetro.

API compatible con OpenAI

chat.completions, embeddings, streaming — como en OpenAI. La migración es cambiar el base_url.

api

Hasta 1M de contexto

aist-llm-pro — 256K; versión ampliada de 1M. Un libro entero o una base de contratos en una sola petición.

long-context

Function-calling

El modelo invoca sus API por sí mismo. Tool-calls en paralelo, structured output, JSON-mode.

tools · json

Vision & multimodal

aist-llm-vision admite hasta 20 imágenes por petición. Documentos, esquemas, gráficos, UI.

vision

Fine-tuning

Reentrenamiento para su dominio — 500–5000 ejemplos y al día siguiente tiene su modelo.

finetune · lora

Streaming <200 ms

Stream SSE, TTFT ~200 ms. El usuario ve la respuesta al instante, sin esperar 10 segundos de silencio.

stream · sse

Prompt-cache

Los prompts de sistema repetidos y el contexto RAG se cachean. Un 40% menos en la factura.

cache · finops

Modo batch

Un millón de peticiones por noche — un 50% más barato que las síncronas. Para auditorías y etiquetado.

batch

Guardrails & PII

Filtros de temas, protección contra inyecciones, enmascaramiento de PII a la entrada y a la salida.

safety

Embeddings

aist-embed-ru-v3, 1024-d, hasta 8K tokens. 2 ₽ / 1M. Para RAG y búsqueda.

vectors

Panel de uso

Peticiones por clave, tokens, coste, errores, latencia p50/p95/p99.

analytics

SDK & integraciones

Python, Node, Go, Rust, .NET, 1С. Compatible con LangChain, LlamaIndex, AutoGen.

sdk
// tarifas & modelos de consumo

Pague solo por lo que usa. Sin riesgos cambiarios.

Precios transparentes por tokens. Descuentos por volumen, modo batch, compra de reserved-capacity. Presupuestos por claves y equipos — para que el CFO no se sobresalte con las facturas.

// tarificación

per-tokenreserved capacitybatch −50%cache −40%volume discountlicencia on-prem

// modelos

aist-llm-proaist-llm-lightaist-llm-codeaist-llm-visionaist-embed-ru+ fine-tuned

// formas de pago

transferencia bancariaprepagopago diferido (B2B)tarjetapago instantáneo

// sdk & plataformas

OpenAI PythonOpenAI Node1С (cliente HTTP)cURLLangChainLlamaIndex

// regiones

ru-central-1 (Moscú)ru-northwest-1 (San Petersburgo)ru-siberia-1 (Novosibirsk)on-prem su CPD

// integración con los servicios AiST

RAGOCRASRImageVideoDialogAgentModeration

Precios claros, previsibles, corporativos.

Free-tier para empezar (100 mil tokens en Pro). Descuento por volumen y reserved-capacity. Para clientes corporativos — pago diferido por factura, presupuestos por departamento, contrato único. Sin «sorpresas nocturnas» en la factura.

40 ₽/ 1M tokens Pro
4 ₽/ 1M tokens Light
−40%con prompt-cache
Pay-as-you-go

Pago según el uso real. Empieza con 100K tokens gratuitos y después — según tarifa.

Reserved capacity

Capacidad reservada con un descuento del 30–50%. Para cargas altas y estables.

Licencia on-prem

Licencia perpetua para desplegar en su perímetro. Sin facturación por tokens: solo paga su propio hardware.

// qué se construye con AiST LLM

Desde el chat corporativo hasta agentes en producción y modelos custom.

El LLM es la infraestructura de las aplicaciones de IA. Cualquier asistente, agente, buscador, analítica o chat suyo vive sobre un LLM. Es el bloque de construcción básico sin el cual nada funciona.

// chat corporativo

Un ChatGPT corporativo en su perímetro

Panel web, bot de Telegram, widget en 1С — los empleados conversan con el LLM sin que los datos se filtren a OpenAI. Todas las peticiones — bajo auditoría, por roles, conforme a la 152-ФЗ.

RBACauditoría152-ФЗ
// desarrollo

Code-assistant en el IDE

aist-llm-code en VSCode, Cursor, JetBrains mediante la API estándar. Generación, refactorización, tests, revisión de PR. Conoce 1С, Python, TS y su legacy.

VSCodecode-review
// aplicaciones de ia

Backend para sus funciones de IA

Bajo el capó de su producto — nuestra LLM-API. Asistente de chat, clasificación, resúmenes, generación de descripciones de producto. Una API para todo el producto.

SaaSweb-appmobile
// fine-tuning

Modelo custom para su sector

Reentrenamiento con 5000 ejemplos de su terminología (medicina, derecho, oil & gas) — y el modelo responde «como su experto». Calidad en su dominio — +20–40%.

LoRASFTRLHF
// agentes

Motor para AiST Agent

Bajo nuestros agentes — nuestro propio LLM. Function-calling, JSON-mode, contexto largo, baja latencia. Un agente de 100 pasos termina en 3 minutos.

toolsmulti-step200K ctx
// research & analítica

Procesamiento batch de millones de registros

«Clasifique 10 millones de reseñas», «resuma 1 millón de llamadas», «extraiga los hechos de 500 000 contratos» — la batch-API es un 50% más barata y termina en una noche.

batchsummaryclassification
// ya en la plataforma

Los modelos propios son la base de todos los demás servicios de AiST.

Cada servicio de AiST utiliza por debajo nuestros propios LLM. RAG genera respuestas con Pro, Dialog conversa con Light, Agent trabaja con Pro y function-calling, OCR usa además Vision. Al contratar AiST LLM — tiene todo el ecosistema al alcance de la mano.

No es solo una API. Es todo el ecosistema AiST.

Puede contratar solo la API y construir lo suyo. O usar directamente los servicios listos sobre el LLM: RAG para buscar en documentos, Agent para tareas autónomas, Dialog para atender a los clientes. Un solo panel, una sola factura, moderación y auditoría unificadas.

«Usábamos GPT-4 a través de VPN, preocupados cada día por la 152-ФЗ. Pasamos a aist-llm-pro — la calidad resultó ser superior, factura transparente, sin VPN ni riesgos jurídicos»

Qué más ofrece AiST Platform
4 modelos + embeddingsPro · Light · Code · Vision · Embed
listo
API compatible con OpenAImigración en 5 minutos
listo
Dedicated & on-prem & air-gappedpara cualquier nivel de seguridad
listo
Streaming + tools + JSON200 ms TTFT
listo
Prompt-cache + batch−40% y −50% en la factura
listo
Fine-tuning para su dominioLoRA · SFT · RLHF
listo
Guardrails + PII + RBACprotección a la entrada y a la salida
listo
Integración con RAG / Agent / Dialogtodo el ecosistema encima
listo
// control corporativo

LLM sin VPN y sin riesgos jurídicos: 152-ФЗ y contrato local.

GPT-4 a través de VPN infringe las condiciones de uso de OpenAI y supone un riesgo potencial frente a la 152-ФЗ. AiST LLM resuelve ambos problemas: los modelos en su perímetro, facturación transparente, contrato conforme a la legislación local.

// para el CISO

Perímetro cerrado

  • On-prem o AiST BOX en su CPD
  • Variante air-gapped para infraestructuras críticas
  • Las peticiones no salen al extranjero
  • RBAC: claves por equipo, scopes por modelo
  • Protección contra prompt-injection a la entrada
  • Exportación al SIEM de cada petición
// para los juristas

Seguridad jurídica

  • 152-ФЗ — datos personales en su perímetro
  • Contrato bajo jurisdicción local
  • Sin VPN ni infracciones de ToS
  • Inscrito en el registro nacional de software
  • Certificación ФСТЭК (en curso)
  • Compatible con СТР-К
// para el CFO

Gastos transparentes

  • Facturación sin riesgos cambiarios
  • Presupuestos por claves y equipos
  • Caché y batch — un 40–50% menos en la factura
  • Reserved capacity con un descuento del 30–50%
  • Pago diferido por factura para B2B
  • Documentación de cierre según el estándar local
// preguntas frecuentes

Lo que suelen preguntarnos antes de migrar desde OpenAI.

¿De verdad la calidad no es inferior a GPT-4 / Claude?

aist-llm-pro está al nivel de Claude Sonnet y GPT-4o, y en varios dominios (textos jurídicos, 1С, informes administrativos) es notablemente más preciso, porque se entrenó teniendo en cuenta esas especificidades. Le mostraremos un benchmark con sus propias tareas en una semana de piloto.

¿Cuánto tarda la migración desde OpenAI?

5 minutos para el código. Cambie el `base_url` del OpenAI SDK a `https://api.aist.ai/v1` y el nombre del modelo a `aist-llm-pro` — y todo funciona. Streaming, function-calling y JSON-mode son compatibles uno a uno.

¿Se puede desplegar el modelo en nuestro CPD?

Sí, la versión on-prem se suministra para Pro, Light, Code, Vision y Embed. Calculamos el dimensionamiento de GPU según su tráfico (normalmente 1–4 H100 para una corporación media). La entrega air-gapped se realiza en soporte físico, sin internet.

¿Realmente se puede afinar el modelo con nuestra terminología?

Sí. Mínimo 500 ejemplos de calidad «pregunta-respuesta» en su estilo. Lo óptimo — 2000–5000. En un día — su modelo custom a través de la misma API. Puede mantener varios modelos fine-tuned a la vez, para distintos equipos.

¿Cuánto costaría con nuestra carga?

Lo calculamos según su perfil de peticiones. Como referencia: una corporación media de 1000 empleados con chat corporativo — ~50–150 mil ₽/mes en Pro con caché. Para cargas altas, la reserved capacity ofrece un 30–50% de descuento. Para air-gapped — licencia única + su propio hardware.

¿Podemos usar solo el LLM o hay que contratar toda la plataforma?

Puede contratar solo la LLM-API — es un producto completo. Pero la verdadera potencia surge en combinación con RAG (búsqueda en documentos), Agent (tareas autónomas), Dialog (widget y mensajería), OCR/ASR/Image. Un solo panel, una sola factura, auditoría unificada.

// next step

Obtenga una clave de API en 5 minutos y mida la calidad con sus propias peticiones.

Regístrese — reciba una clave y 100 mil tokens gratuitos en aist-llm-pro. Pruebe sus prompts y compare con GPT-4 o Claude. Decida sobre la base de cifras.

// al enviar, usted acepta el tratamiento de sus datos personales