Ir al contenido principal
Javadex

Operar Ollama en el Servidor de la Empresa: Guía de Operación para Equipos de IT (2026)

11 min

Instalar Ollama es una tarde; operarlo en el servidor de la empresa es otra cosa. Guía de operación para equipos de IT: actualización de modelos sin downtime, GPU compartida, API expuesta con seguridad, control de coste y backups. Septiembre 2026.

Aplicarlo en mi empresa Diagnóstico de 30 min · sin compromiso
Índice del artículo7 secciones

Operar Ollama en el Servidor de la Empresa: Guía de Operación para Equipos de IT (2026)

En una frase: instalar Ollama lleva una tarde; operarlo en producción es un servicio más del servidor — actualización de modelos sin downtime, una GPU compartida entre servicios, una API que no queda expuesta por accidente y un plan de rollback — y esta guía cubre exactamente esa parte que los tutoriales de instalación se saltan. Verificado sobre Ollama de septiembre de 2026.

La escribo como Javier Santos Criado, consultor IA en Javadex tras operar despliegues locales en pymes (ingenierías, asesorías y distribuidores; el caso real de planificación de obra es un ejemplo). Si prefieres que lo operemos nosotros, Cortex by Javadex es la versión gestionada de todo esto.

¿Cuándo Ollama en producción es la decisión correcta?#

Es la respuesta a la pregunta que le hace tu dirección, no la que haces tú:

SituaciónOllama localAPI en la nube
Datos que no pueden salir (contratos, expedientes, salud)Solo con enterprise/Zona UE y contrato
Volumen alto de tareas rutinarias (resumir, clasificar, extraer)✅ Coste marginal ~0Se factura por token
Tareas que piden el mejor modelo posible⚠️ Los modelos de frontera abiertos van por detrás
Equipo sin perfil técnico
Picos impredecibles de carga⚠️ La GPU es finita

El patrón híbrido es lo normal: lo sensible y lo voluminoso, local; los picos y lo complejo, API. El análisis de hardware para IA local en empresas cubre la decisión de compra; aquí vamos a lo que pasa después de comprar.

Actualizar modelos sin romper producción#

La operación nº1 que rompe despliegues: ollama pull de un modelo con la misma etiqueta mientras el servicio sirve tráfico, y a las 11:00 los usuarios ven respuestas distintas o el modelo se reinicia a mitad de proceso. Protocolo:

  1. Versiona por etiqueta: qwen3:14b-instruct-q8-v2 en vez de latest. El modelo en producción es una dependencia congelada, no una novedad.
  2. Pull paralelo + cambio de alias: descarga la versión nueva con otra etiqueta, valida con tu suite de evaluación (20-30 casos golden de tu dominio), y solo entonces cambia el alias que consumen las apps.
  3. Ventana de repaso a 24-48 h: compara muestras de la semana nueva contra la vieja antes de borrar la anterior.
  4. Rollback: si la etiqueta anterior sigue en disco, revertir el alias vuelve a la versión anterior en segundos.

La matriz de qué modelos merecen estar en producción hoy está en el ranking de modelos para Ollama (actualización mensual).

Una GPU, varios servicios: la regla que evita los colapsos#

Cuando la GPU de 24 GB tiene encima el chat interno, el RAG documental y el transcriptor, el primer OOM (out of memory) lo tira todo:

  • OLLAMA_MAX_LOADED_MODELS=1-2 y OLLAMA_KEEP_ALIVE calibrado (5-15 min): evita que dos modelos vivan en VRAM "por si acaso".
  • Prioridades por servicio: el asistente que atiende a clientes no comparte cola con el proceso batch nocturno — el batch corre en horario de baja carga o en servidor aparte.
  • Cuota de concurrencia: OLLAMA_NUM_PARALLEL según VRAM; más paralelismo no es gratis, reparte el mismo espacio.
  • Monitorización de VRAM (exporter a tu Grafana/uptime habitual): alerta al 85%, no cuando ya ha caído.

La API segura: los 4 controles no negociables#

Ollama escucha en 0.0.0.0:11434 por defecto en muchas instalaciones, y "la API de IA" acaba en el inventario de nadie:

  1. No expuesta a internet, nunca: solo en la red interna o detrás de un reverse proxy con TLS; acceso remoto por VPN o Tailscale.
  2. Autenticación delante: el endpoint de Ollama no trae auth — el proxy (nginx/Caddy/Traefik) pone SSO o API keys delante, y los logs pasan por ahí.
  3. Registro de uso: quién, qué modelo, cuántos tokens, desde qué app. Sin esto, la primera conversación de "¿cuánto nos está costando esto?" no tiene respuesta.
  4. Rate limit por servicio: que un script descontrolado no degrade el servicio de todos.

Si tu caso necesita varios proveedores y contabilidad fina por equipo, ese delante es un proxy multi-modelo tipo LiteLLM — la guía de montaje está en el enlace.

Copia de seguridad y recuperación (la parte que nadie prueba)#

  • Los modelos son descargables — no los copies, documenta: guarda un manifest de etiquetas y tamaños; restaurar es un pull en el nodo nuevo.
  • Lo que sí se copia: la configuración (Modelfiles personalizados, variables, proxy), las bases vectoriales y los logs de uso.
  • Prueba una vez de verdad: restaurar en una VM y que alguien responda una pregunta con el RAG. Un backup no probado es una esperanza, no un plan.

¿Para quién NO es esta vía?#

  • Equipos sin perfil técnico: el mantenimiento (actualizaciones, monitorización, incidentes) no es opcional y alguien tiene que hacerlo.
  • Necesidad de los mejores modelos en producción: los abiertos van 1-2 generaciones por detrás de Claude o GPT en tareas complejas; si la calidad manda, API (con empresa/UE si hay datos sensibles).
  • Un solo usuario: para una persona, la guía simple de Ollama basta; esto es para servicios con usuarios de verdad.

Si tras leer esto tu conclusión es "esto lo tiene que operar alguien con SLA": es una línea del servicio que hago en Javadex — despliegue, operación, monitorización y esa capa de modelos de frontera cuando la tarea la pide, todo con tu marca y tus datos dentro.

Cuéntame qué quieres tener en producción →

Preguntas frecuentes#

¿Ollama en producción consume mucha GPU si nadie lo usa?#

Con OLLAMA_KEEP_ALIVE calibrado (5-15 minutos), el modelo se descarga de VRAM tras el último uso y la GPU queda libre. El primer usuario después de la pausa espera 5-20 segundos de carga: es el trade-off estándar entre VRAM libre y latencia.

¿Cómo actualizo un modelo sin afectar a los usuarios?#

Versionado por etiqueta: descarga la nueva versión con otra etiqueta, valida con casos de evaluación propios, cambia el alias de consumo y conserva la anterior para rollback inmediato. Nunca hagas pull sobre la etiqueta que sirve tráfico.

¿Puedo exponer la API de Ollama a internet?#

No directamente: Ollama no trae autenticación propia. Se expone detrás de un reverse proxy con TLS y autenticación (o solo en red interna/VPN), con logging de uso y rate limit por servicio.

¿Cuánto cuesta mantener un servidor de IA local al mes?#

El hardware está amortizado; el coste recurrente real son las horas de operación (actualizaciones, monitorización, incidentes) y la electricidad. Para pymes, el patrón híbrido — local para lo sensible y voluminoso, API para picos — mantiene el recibo eléctrico y de API bajo control.

¿Quieres todo esto en una plataforma con TU marca?

Cortex by Javadex te monta tu propio ChatGPT corporativo en 30 días: multi-modelo, conectado a tu stack, datos en Europa y con tu logo. Sin SaaS, sin lock-in, sin coste por usuario. Desde 5.000€.

Ver Cortex en detallejavi@javadex.es
Javier Santos - Especialista en IA & Machine Learning

Javier Santos

Consultor de IA para empresas. Comparto contenido sobre inteligencia artificial, automatización y desarrollo cada semana.