Operar Ollama en el Servidor de la Empresa: Guía de Operación para Equipos de IT (2026)
En una frase: instalar Ollama lleva una tarde; operarlo en producción es un servicio más del servidor — actualización de modelos sin downtime, una GPU compartida entre servicios, una API que no queda expuesta por accidente y un plan de rollback — y esta guía cubre exactamente esa parte que los tutoriales de instalación se saltan. Verificado sobre Ollama de septiembre de 2026.
La escribo como Javier Santos Criado, consultor IA en Javadex tras operar despliegues locales en pymes (ingenierías, asesorías y distribuidores; el caso real de planificación de obra es un ejemplo). Si prefieres que lo operemos nosotros, Cortex by Javadex es la versión gestionada de todo esto.
¿Cuándo Ollama en producción es la decisión correcta?#
Es la respuesta a la pregunta que le hace tu dirección, no la que haces tú:
| Situación | Ollama local | API en la nube |
|---|---|---|
| Datos que no pueden salir (contratos, expedientes, salud) | ✅ | Solo con enterprise/Zona UE y contrato |
| Volumen alto de tareas rutinarias (resumir, clasificar, extraer) | ✅ Coste marginal ~0 | Se factura por token |
| Tareas que piden el mejor modelo posible | ⚠️ Los modelos de frontera abiertos van por detrás | ✅ |
| Equipo sin perfil técnico | ❌ | ✅ |
| Picos impredecibles de carga | ⚠️ La GPU es finita | ✅ |
El patrón híbrido es lo normal: lo sensible y lo voluminoso, local; los picos y lo complejo, API. El análisis de hardware para IA local en empresas cubre la decisión de compra; aquí vamos a lo que pasa después de comprar.
Actualizar modelos sin romper producción#
La operación nº1 que rompe despliegues: ollama pull de un modelo con la misma etiqueta mientras el servicio sirve tráfico, y a las 11:00 los usuarios ven respuestas distintas o el modelo se reinicia a mitad de proceso. Protocolo:
- Versiona por etiqueta:
qwen3:14b-instruct-q8-v2en vez delatest. El modelo en producción es una dependencia congelada, no una novedad. - Pull paralelo + cambio de alias: descarga la versión nueva con otra etiqueta, valida con tu suite de evaluación (20-30 casos golden de tu dominio), y solo entonces cambia el alias que consumen las apps.
- Ventana de repaso a 24-48 h: compara muestras de la semana nueva contra la vieja antes de borrar la anterior.
- Rollback: si la etiqueta anterior sigue en disco, revertir el alias vuelve a la versión anterior en segundos.
La matriz de qué modelos merecen estar en producción hoy está en el ranking de modelos para Ollama (actualización mensual).
Una GPU, varios servicios: la regla que evita los colapsos#
Cuando la GPU de 24 GB tiene encima el chat interno, el RAG documental y el transcriptor, el primer OOM (out of memory) lo tira todo:
OLLAMA_MAX_LOADED_MODELS=1-2yOLLAMA_KEEP_ALIVEcalibrado (5-15 min): evita que dos modelos vivan en VRAM "por si acaso".- Prioridades por servicio: el asistente que atiende a clientes no comparte cola con el proceso batch nocturno — el batch corre en horario de baja carga o en servidor aparte.
- Cuota de concurrencia:
OLLAMA_NUM_PARALLELsegún VRAM; más paralelismo no es gratis, reparte el mismo espacio. - Monitorización de VRAM (exporter a tu Grafana/uptime habitual): alerta al 85%, no cuando ya ha caído.
La API segura: los 4 controles no negociables#
Ollama escucha en 0.0.0.0:11434 por defecto en muchas instalaciones, y "la API de IA" acaba en el inventario de nadie:
- No expuesta a internet, nunca: solo en la red interna o detrás de un reverse proxy con TLS; acceso remoto por VPN o Tailscale.
- Autenticación delante: el endpoint de Ollama no trae auth — el proxy (nginx/Caddy/Traefik) pone SSO o API keys delante, y los logs pasan por ahí.
- Registro de uso: quién, qué modelo, cuántos tokens, desde qué app. Sin esto, la primera conversación de "¿cuánto nos está costando esto?" no tiene respuesta.
- Rate limit por servicio: que un script descontrolado no degrade el servicio de todos.
Si tu caso necesita varios proveedores y contabilidad fina por equipo, ese delante es un proxy multi-modelo tipo LiteLLM — la guía de montaje está en el enlace.
Copia de seguridad y recuperación (la parte que nadie prueba)#
- Los modelos son descargables — no los copies, documenta: guarda un
manifestde etiquetas y tamaños; restaurar es unpullen el nodo nuevo. - Lo que sí se copia: la configuración (Modelfiles personalizados, variables, proxy), las bases vectoriales y los logs de uso.
- Prueba una vez de verdad: restaurar en una VM y que alguien responda una pregunta con el RAG. Un backup no probado es una esperanza, no un plan.
¿Para quién NO es esta vía?#
- Equipos sin perfil técnico: el mantenimiento (actualizaciones, monitorización, incidentes) no es opcional y alguien tiene que hacerlo.
- Necesidad de los mejores modelos en producción: los abiertos van 1-2 generaciones por detrás de Claude o GPT en tareas complejas; si la calidad manda, API (con empresa/UE si hay datos sensibles).
- Un solo usuario: para una persona, la guía simple de Ollama basta; esto es para servicios con usuarios de verdad.
Si tras leer esto tu conclusión es "esto lo tiene que operar alguien con SLA": es una línea del servicio que hago en Javadex — despliegue, operación, monitorización y esa capa de modelos de frontera cuando la tarea la pide, todo con tu marca y tus datos dentro.
→ Cuéntame qué quieres tener en producción →
Preguntas frecuentes#
¿Ollama en producción consume mucha GPU si nadie lo usa?#
Con OLLAMA_KEEP_ALIVE calibrado (5-15 minutos), el modelo se descarga de VRAM tras el último uso y la GPU queda libre. El primer usuario después de la pausa espera 5-20 segundos de carga: es el trade-off estándar entre VRAM libre y latencia.
¿Cómo actualizo un modelo sin afectar a los usuarios?#
Versionado por etiqueta: descarga la nueva versión con otra etiqueta, valida con casos de evaluación propios, cambia el alias de consumo y conserva la anterior para rollback inmediato. Nunca hagas pull sobre la etiqueta que sirve tráfico.
¿Puedo exponer la API de Ollama a internet?#
No directamente: Ollama no trae autenticación propia. Se expone detrás de un reverse proxy con TLS y autenticación (o solo en red interna/VPN), con logging de uso y rate limit por servicio.
¿Cuánto cuesta mantener un servidor de IA local al mes?#
El hardware está amortizado; el coste recurrente real son las horas de operación (actualizaciones, monitorización, incidentes) y la electricidad. Para pymes, el patrón híbrido — local para lo sensible y voluminoso, API para picos — mantiene el recibo eléctrico y de API bajo control.

