Ir al contenido principal
Javadex

Cómo Montar tu Propio ChatGPT Multi-modelo con LibreChat y LiteLLM: Guía para Desarrolladores (2026)

13 min

LibreChat + LiteLLM es el stack open source estándar para montar un ChatGPT multi-modelo propio: una interfaz, todos los modelos (Claude, GPT, Gemini, Ollama), control de gasto por equipo y datos en tu servidor. Tutorial completo paso a paso para desarrolladores, con las 4 piezas que faltan para pasarlo a producción empresarial.

Aplicarlo en mi empresa Diagnóstico de 30 min · sin compromiso
Índice del artículo6 secciones

Cómo Montar tu Propio ChatGPT Multi-modelo con LibreChat y LiteLLM: Guía para Desarrolladores (2026)

En una frase: con LibreChat (interfaz de chat) + LiteLLM (proxy que unifica Claude, GPT, Gemini y Ollama bajo una sola API) puedes montar en un servidor propio, en una tarde, un "ChatGPT corporativo" multi-modelo con usuarios, RAG y control de gasto — el coste es el del VPS más el consumo de API, y lo que separa ese prototipo de una plataforma de producción empresarial son 4 piezas: SSO, permisos por documento, observabilidad y soporte. Guía verificada sobre Docker en septiembre de 2026.

Soy Javier Santos Criado, consultor IA en Javadex; esta es la misma arquitectura que implantamos en empresas (nuestra versión gestionada es Cortex by Javadex), escrita para quien prefiere montarla él mismo. Si tras leerla tu conclusión es "prefiero que me lo monten", el final del post te dice cómo lo hacemos.

¿Qué es exactamente el stack LibreChat + LiteLLM (y por qué no es un "ChatGPT clon")?#

Dos piezas con responsabilidades separadas:

PiezaQué hacePor qué importa
LibreChatInterfaz de chat open source: multi-modelo, historial, artefactos, búsqueda de conversaciones, RAG (subida de documentos), plugins/MCPEs la cara que verán tus usuarios; soporta agentes y herramientas
LiteLLMProxy que expone una única API compatible con OpenAI hacia 100+ proveedores: Anthropic, Google, OpenAI, Bedrock, OllamaCentraliza claves, hace routing, fallback entre modelos, presupuestos por equipo/usuario y logging de consumo
(opcional) OllamaServe de modelos locales en tu GPUModelos que no salen de tu red
(opcional) pgvectorVector store para el RAG de LibreChatBúsqueda semántica sobre tus documentos

El diseño correcto: toda la inteligencia de modelo pasa por LiteLLM, y LibreChat (o cualquier app interna) solo conoce la clave del proxy. Así puedes cambiar de proveedor sin tocar los clientes, medir el coste por equipo y apagar a un usuario que se está bebiendo el presupuesto.

¿Qué necesito para montarlo? (hardware y software, 2026)#

  • Servidor: un VPS de 4 vCPU/8 GB tira el stack sin RAG pesado; con Ollama local necesitas GPU (una mini PC con NPU o un servidor con RTX — tengo el análisis de hardware para IA local en empresas). Presupuesto de VPS: 20-60 €/mes; con GPU local, 1.500-4.000 € de equipo.
  • Docker + Docker Compose (todo el stack son contenedores).
  • Claves de API de los proveedores que quieras (Anthropic, Google, OpenAI) o solo Ollama si va todo local.
  • Un dominio + TLS (LibreChat en producción sin HTTPS no es negociable).

Montarlo paso a paso#

1. LiteLLM primero (el proxy)#

yaml
1# docker-compose.litellm.yml (extracto)
2services:
3 litellm:
4 image: ghcr.io/berriai/litellm:main-latest
5 ports: ["4000:4000"]
6 environment:
7 - ANTHROPIC_API_KEY=${ANTHROPIC_KEY}
8 - OPENAI_API_KEY=${OPENAI_KEY}
9 - GEMINI_API_KEY=${GEMINI_KEY}
10 volumes:
11 - ./litellm_config.yaml:/app/config.yaml
12 command: ["--config", "/app/config.yaml", "--port", "4000"]

yaml
1# litellm_config.yaml
2model_list:
3 - model_name: claude-sonnet
4 litellm_params: { model: anthropic/claude-sonnet-4-6 }
5 - model_name: gpt-frontier
6 litellm_params: { model: openai/gpt-5-5 }
7 - model_name: gemini-pro
8 litellm_params: { model: gemini/gemini-3.1-pro }
9 - model_name: local-qwen
10 litellm_params: { model: ollama/qwen3, api_base: http://ollama:11434 }
11 
12router_settings:
13 fallbacks:
14 - claude-sonnet: ["gemini-pro"] # si Anthropic falla, rutea a Google
15general_settings:
16 master_key: os.environ/LITELLM_MASTER_KEY

Con esto ya tienes: un endpoint OpenAI-compatible en :4000/v1, fallbacks automáticos y presupuestos por usuario/equipo (litellm budgets). Es la pieza que la mayoría se salta y la que decide si el proyecto escala o muere en la factura.

2. LibreChat apuntando al proxy#

yaml
1# librechat.yaml (extracto)
2endpoints:
3 custom:
4 - name: "Proxy Javadex"
5 apiKey: "${LITELLM_KEY}"
6 baseURL: "http://litellm:4000/v1"
7 models:
8 default: [claude-sonnet, gpt-frontier, gemini-pro, local-qwen]

LibreChat lee esa config y aparece en la interfaz un selector con los 4 modelos. Usuarios registrados, historial en MongoDB, y con ragApi + pgvector, subida de documentos con búsqueda semántica.

3. RAG sobre tus documentos#

LibreChat trae RAG por conversación (subes PDFs al chat). Para una base de conocimiento de empresa (contratos, procedimientos, propuestas) necesitas: colecciones por equipo, .chunkSize calibrado a tus documentos y — el detalle que marca la diferencia — citas a fuente en cada respuesta. El patrón completo (arquitectura, permisos, chunking) lo tengo en cómo montar un copiloto interno con RAG para tu empresa.

4. Ponerlo delante de gente#

  • SSO con Google Workspace o Azure AD (LibreChat lo soporta) — sin SSO, en dos semanas cada uno tiene tres cuentas y nadie sabe qué modelo usa quién.
  • Roles: admin / usuario / solo-lectura.
  • Backup de Mongo + Postgres (volumen nombrado, cron, probado una vez de verdad).
  • Observabilidad: LiteLLM loguea cada llamada (modelo, tokens, coste, usuario); con un dashboard encima sabes qué equipo gasta qué — que es justo la conversación que decide si el proyecto continúa.

¿Cuánto cuesta este stack al mes?#

ConceptoCoste (septiembre 2026)
VPS 8 GB20-60 €/mes
Licencias de software0 € (todo open source)
Consumo API (25 usuarios, uso moderado)150-600 €/mes según modelos
Con Ollama localHardware amortizado + electricidad; API solo para picos

La comparación con las alternativas licenciadas la tienes en cuánto cuesta un ChatGPT corporativo para una empresa y, si valoras Gemini, en cuánto cuesta Gemini para empresas.

Las 4 piezas que faltan para producción empresarial#

Este es el filtro honesto: el stack de arriba es un sábado de trabajo; producción en una empresa con datos de clientes añade:

  1. Permisos por documento: LibreChat tiene RAG plano; en una empresa, un comercial no debe poder preguntar sobre las nóminas. Hay que construir ACL sobre la colección vectorial.
  2. Citas verificables: en legal o fiscal, una respuesta sin página de origen no sirve. Requiere RAG con referencias reforzado, no el de serie.
  3. Observabilidad de calidad (no solo coste): evals automáticos sobre las respuestas para detectar degradaciones al cambiar de modelo.
  4. Soporte y SLA: cuando el proxy cae un jueves a las 9:00, alguien tiene que tenerlo en producción — y no es el becario que lo montó.

Si tu equipo tiene los skills y el caso es acotado, montadlo vosotros con esta guía — es una gran manera de aprender. Si toca documentación confidencial, más de 20 usuarios y un director que pide "¿esto está funcionando?", es el proyecto que hago en Javadex: primero el diagnóstico del proceso, luego la plataforma con tu marca, tus datos en Europa y todos los modelos en una interfaz, en torno a un mes.

Cuéntame qué quieres montar →

Preguntas frecuentes#

¿LibreChat y LiteLLM son gratis?#

Sí, ambos son open source. El coste real es el servidor (20-60 €/mes), el consumo de API de los modelos y — si es para una empresa — las horas de mantenimiento: SSO, backups, actualizaciones y permisos.

¿Puedo usar modelos locales (Ollama) junto a Claude y GPT en LibreChat?#

Sí, y es el uso más inteligente del proxy: Ollama para los volúmenes altos y modelos locales por privacidad, y los modelos de frontera para lo que lo merece. LiteLLM rutea entre ellos y aplica fallback si uno cae.

Montado en servidores propios (o en la UE) con modelos que no entrenan con tus datos, es el escenario más limpio que existe: tus datos no salen de tu infraestructura. La parte delicada no es LibreChat sino dónde apunta el proxy y qué retención tiene cada proveedor — se configura y se documenta.

¿Cuánto tarda montarlo un desarrollador?#

Un prototipo funcional con 3 modelos y RAG básico, una tarde. Con SSO, roles, backups y presupuestos por equipo, 2-5 días. La versión empresarial completa (permisos por documento, citas, evals, soporte), un mes.

¿Es mejor esto que ChatGPT Enterprise?#

Depende de lo que pagues con qué: Enterprise da governance y SSO en un par de clics, pero ~60 $/usuario/mes con mínimo de ~150 licencias. LibreChat + LiteLLM cuesta la infraestructura más el consumo, te deja usar todos los modelos en una interfaz y no te ata a un proveedor. Para pymes españolas de 5-50 personas, la balanza casi siempre cae del lado propio.

¿Quieres todo esto en una plataforma con TU marca?

Cortex by Javadex te monta tu propio ChatGPT corporativo en 30 días: multi-modelo, conectado a tu stack, datos en Europa y con tu logo. Sin SaaS, sin lock-in, sin coste por usuario. Desde 5.000€.

Ver Cortex en detallejavi@javadex.es
Javier Santos - Especialista en IA & Machine Learning

Javier Santos

Consultor de IA para empresas. Comparto contenido sobre inteligencia artificial, automatización y desarrollo cada semana.