AiST.Ai
aist.ai-gateway / 50+ models · pago en ₽

Cualquier LLM del mundo — a través de una sola API y desde Rusia.

GPT-4, Claude, Gemini, o1, Llama, GigaChat, su modelo local — todo en un único endpoint, API compatible con OpenAI. Pago en rublos, contrato con una persona jurídica de la Federación Rusa, cumplimiento de la ley 152-ФЗ. Enrutamiento inteligente por precio, latencia, región o fallback ante fallos del proveedor — cambia el modelo en la configuración, no en el código. Facturación y límites unificados por equipos, auditoría de solicitudes, reintentos y caché de respuestas listos para usar.

  • Pago en ₽ · contrato en la FR
  • API compatible con OpenAI
  • Latencia <120 ms
  • 152-ФЗ · auditoría
// el problema

En Rusia, el acceso a las LLM siempre es un problema.

OpenAI bloquea, Anthropic no acepta pagos, no se puede registrar una persona jurídica rusa, las claves se revocan. Gateway resuelve los tres problemas con una sola conexión.

// acceso

No hay una vía legal hacia OpenAI y Anthropic

Los proveedores extranjeros bloquean las IP rusas, las tarjetas bancarias y las personas jurídicas. Los rodeos por VPN están prohibidos por la política corporativa y son inestables.

Proxy a través de una entidad jurídica en la UE/EAU + contrato con AiST en la Federación Rusa. Legal, estable y con documentación de cierre.
// pago

Es imposible pagar los tokens en divisas

SWIFT no funciona, las tarjetas no se aceptan y contabilidad no tramitará criptomonedas. Pierde horas en soluciones alternativas en lugar de desarrollar.

Pago por factura en rublos, acta + factura fiscal, con la periodicidad que prefiera. Un solo contrato — todos los proveedores del mundo.
// escala

Sus propios modelos no soportan la carga

vLLM se cae, la GPU permanece inactiva, la cola crece. El equipo de ML-ops se convierte en el cuello de botella de todos los lanzamientos de producto.

Conectamos su self-hosted al Gateway: load-balancing, fallback, autoescalado. Su modelo funciona como cualquier otro proveedor.
// catálogo

50+ modelos. Frontier, locales y los suyos propios.

Los mejores modelos del mundo + los mayores modelos rusos + compatibilidad con cualquier open-source mediante self-host. Cambia una línea de código — la aplicación sigue funcionando.

OpenAI🇺🇸

GPT-4o · GPT-4.1 · o1 · o3-mini

visionfunction-call
Anthropic🇺🇸

Claude Sonnet 4.5 · Opus 4 · Haiku 4.5

200k ctxvision
Google🇺🇸

Gemini 2.5 Pro · 2.5 Flash

1M ctxmultimodal
xAI🇺🇸

Grok-4 · Grok-3

realtime
Meta

Llama 4 · 3.3-70B · 3.2-90B

localvision
Mistral🇫🇷

Large 2 · Codestral · Pixtral

localcode
DeepSeek🇨🇳

DeepSeek-R1 · V3

localreasoning
Qwen🇨🇳

Qwen-3 · Qwen-VL · Qwen-Coder

local
Sber🇷🇺

GigaChat Pro · GigaChat Max

RU152-ФЗ
Yandex🇷🇺

YandexGPT 5 Pro · Lite

RU152-ФЗ
T-Bank🇷🇺

T-pro · T-lite

RUlocal
Self-host

Su modelo en su propio perímetro

on-premvLLM · TGI
// interfaz unificada

Un SDK, compatible con OpenAI. Sin reescribir nada.

Cambie el base_url y la clave — y siga programando contra la misma interfaz. Toda la biblioteca de funciones de OpenAI: streaming, tools, JSON-mode, vision, embeddings.

example.py
python node curl
# Cualquier modelo — una sola línea
from openai import OpenAI

client = OpenAI(
  base_url="https://api.aist.ai/v1",
  api_key="aist_sk_...",
)

response = client.chat.completions.create(
  model="claude-sonnet-4.5",  # o gpt-4o, gigachat, llama-70b…
  messages=[{"role": "user", "content": "Hola"}],
  stream=True,
)

Qué incluye

  • Streaming, tools, JSON-mode, vision, embeddings
  • Fallback automático a un modelo de reserva en caso de error
  • Caché de respuestas y deduplicación de solicitudes
  • Métricas, auditoría, presupuestos por equipos y proyectos
  • SDK para Python, JS, Go, Java, Kotlin, Swift
// funcionalidades

Lo que Gateway añade a la API «en bruto».

No somos un simple proxy. Es una capa de protección, control y enrutamiento inteligente sobre cualquier LLM.

Enrutamiento y fallback

Reglas como «si Claude no está disponible → GPT-4o → GigaChat». Enrutamiento basado en latencia, sticky-sessions, tests A/B con tráfico real.

<50 msoverhead
99.97%uptime

Control de gastos

Presupuestos por equipos, proyectos y usuarios. Límites estrictos, alertas en Slack/Telegram, informes en 1С. Panel «a dónde va cada ₽».

−42%ahorro medio
real-timemétricas

Seguridad y PII

Anonimización de datos personales antes de enviarlos a APIs externas, filtros de entrada y salida, auditoría completa de solicitudes. RBAC, SSO, MFA.

152-ФЗcompatible
SOC2type II

Caché y deduplicación

Caché semántica de solicitudes repetidas, caché RAG de embeddings. En cargas típicas ahorra entre un 30 y un 60% de tokens sin pérdida de calidad.

~45%cache hit-rate
×3RPS con las mismas GPU
// escalado de sus propios modelos

Conecte su modelo — Gateway lo pondrá en producción.

Usted entrena el modelo; nosotros nos encargamos del escalado bajo carga, la monitorización, el fallback y la facturación. Su equipo de ML se ocupa de los datos, no de la infraestructura.

01

Autoescalado del pool de GPU

Levantamos nodos adicionales cuando crece el RPS y los apagamos en reposo. Nada de H100 inactivas a su costa.

02

Despliegues canary y tests A/B

Despliegue la nueva versión del modelo sobre el 5% del tráfico, compare métricas y revierta con un solo clic. Sin tiempo de inactividad.

03

Inferencia distribuida

Paralelismo tensorial, speculative decoding, batching. vLLM, TensorRT-LLM y SGLang listos para usar.

04

Monitorización y SLA

Latencia p50/p95/p99, throughput, utilización de GPU, accuracy drift. Alertas en su PagerDuty o bot de Telegram.

05

Fine-tuning como servicio

Suba el dataset, elija el modelo base — y reciba el adaptador. LoRA, QLoRA, full fine-tune, RLHF en sus servidores o en los nuestros.

// preguntas frecuentes

Lo que conviene saber antes de conectarse.

¿Es legal para una persona jurídica de la Federación Rusa?

Sí. AiST es una empresa rusa, con contrato y documentación de cierre conforme a las normas contables rusas (РСБУ). El acceso a los proveedores extranjeros se realiza a través de nuestra entidad jurídica en la UE/EAU. Toda la cadena es transparente, sin ninguna VPN.

¿Qué pasa con la ley 152-ФЗ y el secreto bancario?

Para datos sensibles — solo modelos nacionales o su self-host. Para el resto — anonimización de PII integrada antes del envío. Auditoría de todas las solicitudes, RBAC, SSO.

¿Cuánto cuesta y cómo se paga?

Sin suscripción. Solo paga por los tokens — un recargo del 8–12% sobre el precio oficial del proveedor. Pago por factura en rublos, prepago o pago a 30 días. No hay volumen mínimo.

¿Cómo conecto mi propio modelo?

Si está en su perímetro — nos facilita la URL y lo registramos como proveedor. Si hay que desplegarlo — tomamos su checkpoint de HuggingFace o PyTorch y lo desplegamos en sus GPU o en las nuestras en 48 horas.

¿Qué SLA ofrecen?

99.95% de disponibilidad del Gateway, tiempo de respuesta de 15 minutos (24×7), compensación en tokens en caso de incumplimiento. A nivel de modelos — el fallback conmuta automáticamente al proveedor de reserva.

¿Se puede ejecutar in-house, sin su nube?

Sí. Gateway forma parte de AiST Ai BOX — se instala en su CPD y funciona en un perímetro cerrado. Se conservan todas las funcionalidades.

// next step

La clave en 1 día. El presupuesto de prueba corre a cargo de AiST.

Le enviaremos la clave de API, la documentación y un presupuesto inicial de ₽3 000 para pruebas. Firmaremos el contrato cuando compruebe que funciona.

// al enviar, usted acepta el tratamiento de sus datos personales