AI Server
La plataforma de IA privada para equipos. Un servidor ejecuta los modelos — cada aplicación y cada dispositivo simplemente los usa. AI Server ofrece chat, embeddings, generación de imágenes, voz y visión desde tu propio hardware, mediante API compatibles con OpenAI, a toda la AI Suite y a cualquier herramienta compatible.
Empieza gratis en tu propia máquina. Cuando tu equipo crece, da servicio a tu red; cuando una máquina no basta, el modo AI Gateway convierte varios servidores en un único punto de acceso con balanceo de carga — en tu LAN, en Docker o en Kubernetes. Sin nube de proveedor en la ruta de datos en ningún momento.
Consíguelo en Microsoft Store Mira lo que hace ↓ Licencias y precios
Una sola instalación que impulsa todo
Sin un servidor, cada PC descarga sus propios modelos, necesita su propia GPU y se configura y actualiza por separado. Con AI Server, los modelos se descargan una vez, se ejecutan en el mejor hardware que tengas y dan servicio a todos.
API de IA universales
Puntos de acceso compatibles con OpenAI para chat, embeddings, generación de imágenes, voz a texto (incluida la transmisión en directo), texto a voz, clonación de voz y visión — todo servido desde tu hardware. Apunta a él cualquier herramienta compatible o tu propio código.
Impulsa toda la AI Suite
Cada aplicación de la AI Suite descubre el servidor y le delega su trabajo de IA — sin configuración alguna. Notas, PDF, traducción, dictado, imágenes, correo y más, todo compartiendo un mismo conjunto de modelos en una sola máquina.
Gobernanza integrada
Claves API con planes por clave, límites de tasa, cuotas y presupuestos, análisis de uso por aplicación y modelo, y registros de auditoría sin contenido con exportación firmada. Los controles que espera TI, sin un proveedor de nube de por medio.
Escala con AI Gateway
Activa un interruptor y varios servidores se convierten en un único punto de acceso: balanceo de carga con comprobación de estado, enrutamiento consciente del modelo que prefiere las máquinas que ya lo tienen cargado, despliegues canary y actualizaciones sin tiempo de inactividad.
Funciona en cualquier lugar
Una aplicación de escritorio para la máquina bajo el escritorio; contenedores, manifiestos de Kubernetes y un chart de Helm para el rack o la nube. Mismo producto, mismas API, misma licencia — de un portátil a una granja de GPU.
Observable por diseño
Cada servidor aloja su propio panel en vivo y métricas nativas de Prometheus: salud del parque, latencia, uso y capacidad de un vistazo — sin una pila de monitorización adicional para empezar.
De un servidor a una granja — sin cambiar un solo cliente
AI Gateway es AI Server ejecutándose en su modo de frontal de granja. Los clientes se conectan a él exactamente como si fuera un único AI Server; detrás, un grupo de servidores de trabajo (workers) realiza la inferencia real. Añade una máquina y la capacidad crece; retira una para mantenimiento y el tráfico se drena con suavidad — no se descarta la solicitud de nadie.
En Kubernetes, los workers se descubren automáticamente a medida que escalan, así que una granja con autoescalado no necesita ediciones manuales del grupo. Todo el parque sigue siendo observable desde el panel integrado y las métricas de Prometheus.
Lo que la puerta de enlace gestiona por ti
- Balanceo de carga — por turnos, menor latencia, menos conexiones, ponderado o fijo por cliente.
- Enrutamiento consciente del modelo — las solicitudes van a una máquina que ya tiene cargado el modelo solicitado.
- Conmutación por error — un worker que falla se reintenta en uno sano antes de que el cliente lo note.
- Despliegues canary — envía una porción constante del tráfico a las máquinas nuevas antes de confiar plenamente en ellas.
- Contrapresión — cuando todos los workers están saturados, quien llama recibe un honesto «reinténtalo en breve» en lugar de un tiempo de espera agotado.
- Actualizaciones sin tiempo de inactividad — drena un worker, actualízalo y devuélvelo al grupo.
Empieza gratis. Crece cuando lo haga tu equipo.
El nivel gratuito es un producto real, no una prueba: un servidor de IA local completo para todas las aplicaciones de la AI Suite en tu propia máquina, para siempre. Los niveles de pago comienzan justo donde el valor cruza los límites de una máquina.
Gratis
Un servidor de IA local completo en tu propia máquina. Uso ilimitado por cada aplicación de la AI Suite en esa máquina; los clientes genéricos compatibles con OpenAI tienen límite de tasa.
Pro Personal
Da servicio a tus propios dispositivos por tu red: servicio en LAN, ejecución como servicio del sistema, claves API para tu portátil y tu teléfono, clientes genéricos ilimitados y un pequeño grupo de puerta de enlace.
Pro Commercial
Da servicio a otras personas: uso comercial, claves API ilimitadas, gobernanza completa (cuotas, presupuestos, firma de auditoría) y una granja de puerta de enlace de producción con despliegues canary y descubrimiento automático de workers.
Enterprise
Parques ilimitados, inscripción de organización con AI Admin Console, funcionamiento sin conexión y aislado de la red, y soporte prioritario. Con licencia por parque — habla con nosotros.
Instale la aplicación gratis desde su tienda de aplicaciones. Una suscripción Personal o Commercial directa incluye una clave de producto válida en todas las plataformas compatibles.
Una plataforma de IA privada, varios patrones de despliegue
Centralice modelos costosos y gobernanza mientras cada equipo conserva sus aplicaciones y herramientas OpenAI compatibles.
Oficina y equipos de conocimiento
Comparta modelos aprobados de chat, traducción, reescritura, RAG documental, imagen y voz desde una máquina gestionada, sin descargarlos en cada puesto.
Leer el patrón de despliegue →Cargas reguladas y sensibles
Ofrezca IA a equipos jurídicos, sanitarios, financieros, públicos y de investigación manteniendo prompts, archivos, acceso y auditoría dentro del límite elegido.
Leer el patrón de despliegue →Desarrolladores y plataforma API interna
Conecte aplicaciones OpenAI compatibles, agentes y evaluaciones CI a un endpoint interno. Plataforma controla modelos y capacidad sin una clave de proveedor por proyecto.
Leer el patrón de despliegue →Sucursales, failover y granjas GPU
Sitúe AI Gateway ante workers distribuidos para enrutamiento por salud, afinidad de modelos calientes, mantenimiento gradual y ampliación sin reconfigurar clientes.
Leer el patrón de despliegue →Planifica el primer despliegue alrededor de un flujo real
Demuestra el trabajo útil y el límite de privacidad en una máquina antes de añadir usuarios, políticas o una granja de servidores.
1. Elige la carga de trabajo
Elige una tarea acotada, como chat privado, preguntas sobre documentos, traducción o transcripción, y las personas que la evaluarán.
2. Ajusta el hardware
Selecciona modelo y máquina según el contexto, tiempo de respuesta y usuarios simultáneos esperados. Valida primero con CPU o añade GPU cuando la carga lo necesite.
3. Prueba el límite
Confirma qué clientes, modelos, registros y rutas de red están permitidos. Mantén instrucciones y archivos dentro del límite elegido.
4. Añade control al crecer
Pasa al servicio en red, claves API y cuotas, y después registra el entorno en AI Admin Console o añade workers de AI Gateway cuando la demanda lo justifique.
Entrega certificada para Azure y AWS
AI Server está disponible como aplicación Kubernetes gratuita/BYOL en Microsoft Marketplace y AWS Marketplace. Su proveedor factura la infraestructura; la misma licencia AI Server Commercial o Enterprise activa la pasarela y los workers.
Microsoft Azure
Instale la aplicación Kubernetes certificada en un clúster AKS existente. Empiece con un nodo CPU para validar el despliegue y añada workers NVIDIA GPU para cargas reales de inferencia.
Buscar en Microsoft MarketplaceAmazon Web Services
Despliegue el paquete Helm de AWS Marketplace en Amazon EKS. Un pequeño grupo de nodos de sistema y workers GPU separados mantienen estables los servicios y facilitan el escalado.
Buscar en AWS MarketplaceTus prompts nunca salen de tu red — porque no hay adónde ir
AI Server no es un proxy a una API en la nube. Los modelos se ejecutan en tu hardware; las solicitudes viajan de tus aplicaciones a tu servidor y de vuelta, dentro de tu perímetro. El funcionamiento sin conexión y aislado de la red son modos de implementación admitidos, no excepciones especiales.
- Ninguna nube de proveedor en la ruta de datos. Los prompts, los documentos y el contenido generado se quedan entre tus clientes y tu servidor.
- Registros sin contenido. Los análisis de uso y los registros de auditoría anotan quién llamó a qué y cuándo — nunca el texto de un prompt o de una respuesta.
- Licencias que fallan de forma segura. Si nuestro servicio de licencias alguna vez no está disponible, tu parque con licencia sigue dando servicio. Tu disponibilidad no depende de la nuestra.
- Tus claves, tus reglas. Las claves API las emites y revocas tú, en tu servidor — no cuentas en la nube de otro.
¿Preguntas sobre AI Server o AI Gateway?
Para ayuda con la implementación, consejos de dimensionamiento, preguntas sobre Kubernetes o licencias, escribe a [email protected] — o usa el formulario de contacto y elige «Producto».