Cualquier LLM del mundo — a través de una sola API y desde Rusia.
GPT-4, Claude, Gemini, o1, Llama, GigaChat, su modelo local — todo en un único endpoint, API compatible con OpenAI. Pago en rublos, contrato con una persona jurídica de la Federación Rusa, cumplimiento de la ley 152-ФЗ. Enrutamiento inteligente por precio, latencia, región o fallback ante fallos del proveedor — cambia el modelo en la configuración, no en el código. Facturación y límites unificados por equipos, auditoría de solicitudes, reintentos y caché de respuestas listos para usar.
- ◉ Pago en ₽ · contrato en la FR
- ↔ API compatible con OpenAI
- ⚡ Latencia <120 ms
- ⛨ 152-ФЗ · auditoría
En Rusia, el acceso a las LLM siempre es un problema.
OpenAI bloquea, Anthropic no acepta pagos, no se puede registrar una persona jurídica rusa, las claves se revocan. Gateway resuelve los tres problemas con una sola conexión.
No hay una vía legal hacia OpenAI y Anthropic
Los proveedores extranjeros bloquean las IP rusas, las tarjetas bancarias y las personas jurídicas. Los rodeos por VPN están prohibidos por la política corporativa y son inestables.
Es imposible pagar los tokens en divisas
SWIFT no funciona, las tarjetas no se aceptan y contabilidad no tramitará criptomonedas. Pierde horas en soluciones alternativas en lugar de desarrollar.
Sus propios modelos no soportan la carga
vLLM se cae, la GPU permanece inactiva, la cola crece. El equipo de ML-ops se convierte en el cuello de botella de todos los lanzamientos de producto.
50+ modelos. Frontier, locales y los suyos propios.
Los mejores modelos del mundo + los mayores modelos rusos + compatibilidad con cualquier open-source mediante self-host. Cambia una línea de código — la aplicación sigue funcionando.
GPT-4o · GPT-4.1 · o1 · o3-mini
Claude Sonnet 4.5 · Opus 4 · Haiku 4.5
Gemini 2.5 Pro · 2.5 Flash
Grok-4 · Grok-3
Llama 4 · 3.3-70B · 3.2-90B
Large 2 · Codestral · Pixtral
DeepSeek-R1 · V3
Qwen-3 · Qwen-VL · Qwen-Coder
GigaChat Pro · GigaChat Max
YandexGPT 5 Pro · Lite
T-pro · T-lite
Su modelo en su propio perímetro
Un SDK, compatible con OpenAI. Sin reescribir nada.
Cambie el base_url y la clave — y siga programando contra la misma interfaz. Toda la biblioteca de funciones de OpenAI: streaming, tools, JSON-mode, vision, embeddings.
# Cualquier modelo — una sola línea from openai import OpenAI client = OpenAI( base_url="https://api.aist.ai/v1", api_key="aist_sk_...", ) response = client.chat.completions.create( model="claude-sonnet-4.5", # o gpt-4o, gigachat, llama-70b… messages=[{"role": "user", "content": "Hola"}], stream=True, )
Qué incluye
- → Streaming, tools, JSON-mode, vision, embeddings
- → Fallback automático a un modelo de reserva en caso de error
- → Caché de respuestas y deduplicación de solicitudes
- → Métricas, auditoría, presupuestos por equipos y proyectos
- → SDK para Python, JS, Go, Java, Kotlin, Swift
Lo que Gateway añade a la API «en bruto».
No somos un simple proxy. Es una capa de protección, control y enrutamiento inteligente sobre cualquier LLM.
Enrutamiento y fallback
Reglas como «si Claude no está disponible → GPT-4o → GigaChat». Enrutamiento basado en latencia, sticky-sessions, tests A/B con tráfico real.
Control de gastos
Presupuestos por equipos, proyectos y usuarios. Límites estrictos, alertas en Slack/Telegram, informes en 1С. Panel «a dónde va cada ₽».
Seguridad y PII
Anonimización de datos personales antes de enviarlos a APIs externas, filtros de entrada y salida, auditoría completa de solicitudes. RBAC, SSO, MFA.
Caché y deduplicación
Caché semántica de solicitudes repetidas, caché RAG de embeddings. En cargas típicas ahorra entre un 30 y un 60% de tokens sin pérdida de calidad.
Conecte su modelo — Gateway lo pondrá en producción.
Usted entrena el modelo; nosotros nos encargamos del escalado bajo carga, la monitorización, el fallback y la facturación. Su equipo de ML se ocupa de los datos, no de la infraestructura.
Autoescalado del pool de GPU
Levantamos nodos adicionales cuando crece el RPS y los apagamos en reposo. Nada de H100 inactivas a su costa.
Despliegues canary y tests A/B
Despliegue la nueva versión del modelo sobre el 5% del tráfico, compare métricas y revierta con un solo clic. Sin tiempo de inactividad.
Inferencia distribuida
Paralelismo tensorial, speculative decoding, batching. vLLM, TensorRT-LLM y SGLang listos para usar.
Monitorización y SLA
Latencia p50/p95/p99, throughput, utilización de GPU, accuracy drift. Alertas en su PagerDuty o bot de Telegram.
Fine-tuning como servicio
Suba el dataset, elija el modelo base — y reciba el adaptador. LoRA, QLoRA, full fine-tune, RLHF en sus servidores o en los nuestros.
Lo que conviene saber antes de conectarse.
¿Es legal para una persona jurídica de la Federación Rusa?
Sí. AiST es una empresa rusa, con contrato y documentación de cierre conforme a las normas contables rusas (РСБУ). El acceso a los proveedores extranjeros se realiza a través de nuestra entidad jurídica en la UE/EAU. Toda la cadena es transparente, sin ninguna VPN.
¿Qué pasa con la ley 152-ФЗ y el secreto bancario?
Para datos sensibles — solo modelos nacionales o su self-host. Para el resto — anonimización de PII integrada antes del envío. Auditoría de todas las solicitudes, RBAC, SSO.
¿Cuánto cuesta y cómo se paga?
Sin suscripción. Solo paga por los tokens — un recargo del 8–12% sobre el precio oficial del proveedor. Pago por factura en rublos, prepago o pago a 30 días. No hay volumen mínimo.
¿Cómo conecto mi propio modelo?
Si está en su perímetro — nos facilita la URL y lo registramos como proveedor. Si hay que desplegarlo — tomamos su checkpoint de HuggingFace o PyTorch y lo desplegamos en sus GPU o en las nuestras en 48 horas.
¿Qué SLA ofrecen?
99.95% de disponibilidad del Gateway, tiempo de respuesta de 15 minutos (24×7), compensación en tokens en caso de incumplimiento. A nivel de modelos — el fallback conmuta automáticamente al proveedor de reserva.
¿Se puede ejecutar in-house, sin su nube?
Sí. Gateway forma parte de AiST Ai BOX — se instala en su CPD y funciona en un perímetro cerrado. Se conservan todas las funcionalidades.
La clave en 1 día. El presupuesto de prueba corre a cargo de AiST.
Le enviaremos la clave de API, la documentación y un presupuesto inicial de ₽3 000 para pruebas. Firmaremos el contrato cuando compruebe que funciona.