Cómo Montar tu Propio ChatGPT Multi-modelo con LibreChat y LiteLLM: Guía para Desarrolladores (2026)
En una frase: con LibreChat (interfaz de chat) + LiteLLM (proxy que unifica Claude, GPT, Gemini y Ollama bajo una sola API) puedes montar en un servidor propio, en una tarde, un "ChatGPT corporativo" multi-modelo con usuarios, RAG y control de gasto — el coste es el del VPS más el consumo de API, y lo que separa ese prototipo de una plataforma de producción empresarial son 4 piezas: SSO, permisos por documento, observabilidad y soporte. Guía verificada sobre Docker en septiembre de 2026.
Soy Javier Santos Criado, consultor IA en Javadex; esta es la misma arquitectura que implantamos en empresas (nuestra versión gestionada es Cortex by Javadex), escrita para quien prefiere montarla él mismo. Si tras leerla tu conclusión es "prefiero que me lo monten", el final del post te dice cómo lo hacemos.
¿Qué es exactamente el stack LibreChat + LiteLLM (y por qué no es un "ChatGPT clon")?#
Dos piezas con responsabilidades separadas:
| Pieza | Qué hace | Por qué importa |
|---|---|---|
| LibreChat | Interfaz de chat open source: multi-modelo, historial, artefactos, búsqueda de conversaciones, RAG (subida de documentos), plugins/MCP | Es la cara que verán tus usuarios; soporta agentes y herramientas |
| LiteLLM | Proxy que expone una única API compatible con OpenAI hacia 100+ proveedores: Anthropic, Google, OpenAI, Bedrock, Ollama… | Centraliza claves, hace routing, fallback entre modelos, presupuestos por equipo/usuario y logging de consumo |
| (opcional) Ollama | Serve de modelos locales en tu GPU | Modelos que no salen de tu red |
| (opcional) pgvector | Vector store para el RAG de LibreChat | Búsqueda semántica sobre tus documentos |
El diseño correcto: toda la inteligencia de modelo pasa por LiteLLM, y LibreChat (o cualquier app interna) solo conoce la clave del proxy. Así puedes cambiar de proveedor sin tocar los clientes, medir el coste por equipo y apagar a un usuario que se está bebiendo el presupuesto.
¿Qué necesito para montarlo? (hardware y software, 2026)#
- Servidor: un VPS de 4 vCPU/8 GB tira el stack sin RAG pesado; con Ollama local necesitas GPU (una mini PC con NPU o un servidor con RTX — tengo el análisis de hardware para IA local en empresas). Presupuesto de VPS: 20-60 €/mes; con GPU local, 1.500-4.000 € de equipo.
- Docker + Docker Compose (todo el stack son contenedores).
- Claves de API de los proveedores que quieras (Anthropic, Google, OpenAI) o solo Ollama si va todo local.
- Un dominio + TLS (LibreChat en producción sin HTTPS no es negociable).
Montarlo paso a paso#
1. LiteLLM primero (el proxy)#
1# docker-compose.litellm.yml (extracto)2services:3 litellm:4 image: ghcr.io/berriai/litellm:main-latest5 ports: ["4000:4000"]6 environment:7 - ANTHROPIC_API_KEY=${ANTHROPIC_KEY}8 - OPENAI_API_KEY=${OPENAI_KEY}9 - GEMINI_API_KEY=${GEMINI_KEY}10 volumes:11 - ./litellm_config.yaml:/app/config.yaml12 command: ["--config", "/app/config.yaml", "--port", "4000"]
1# litellm_config.yaml2model_list:3 - model_name: claude-sonnet4 litellm_params: { model: anthropic/claude-sonnet-4-6 }5 - model_name: gpt-frontier6 litellm_params: { model: openai/gpt-5-5 }7 - model_name: gemini-pro8 litellm_params: { model: gemini/gemini-3.1-pro }9 - model_name: local-qwen10 litellm_params: { model: ollama/qwen3, api_base: http://ollama:11434 }11 12router_settings:13 fallbacks:14 - claude-sonnet: ["gemini-pro"] # si Anthropic falla, rutea a Google15general_settings:16 master_key: os.environ/LITELLM_MASTER_KEY
Con esto ya tienes: un endpoint OpenAI-compatible en :4000/v1, fallbacks automáticos y presupuestos por usuario/equipo (litellm budgets). Es la pieza que la mayoría se salta y la que decide si el proyecto escala o muere en la factura.
2. LibreChat apuntando al proxy#
1# librechat.yaml (extracto)2endpoints:3 custom:4 - name: "Proxy Javadex"5 apiKey: "${LITELLM_KEY}"6 baseURL: "http://litellm:4000/v1"7 models:8 default: [claude-sonnet, gpt-frontier, gemini-pro, local-qwen]
LibreChat lee esa config y aparece en la interfaz un selector con los 4 modelos. Usuarios registrados, historial en MongoDB, y con ragApi + pgvector, subida de documentos con búsqueda semántica.
3. RAG sobre tus documentos#
LibreChat trae RAG por conversación (subes PDFs al chat). Para una base de conocimiento de empresa (contratos, procedimientos, propuestas) necesitas: colecciones por equipo, .chunkSize calibrado a tus documentos y — el detalle que marca la diferencia — citas a fuente en cada respuesta. El patrón completo (arquitectura, permisos, chunking) lo tengo en cómo montar un copiloto interno con RAG para tu empresa.
4. Ponerlo delante de gente#
- SSO con Google Workspace o Azure AD (LibreChat lo soporta) — sin SSO, en dos semanas cada uno tiene tres cuentas y nadie sabe qué modelo usa quién.
- Roles: admin / usuario / solo-lectura.
- Backup de Mongo + Postgres (volumen nombrado, cron, probado una vez de verdad).
- Observabilidad: LiteLLM loguea cada llamada (modelo, tokens, coste, usuario); con un dashboard encima sabes qué equipo gasta qué — que es justo la conversación que decide si el proyecto continúa.
¿Cuánto cuesta este stack al mes?#
| Concepto | Coste (septiembre 2026) |
|---|---|
| VPS 8 GB | 20-60 €/mes |
| Licencias de software | 0 € (todo open source) |
| Consumo API (25 usuarios, uso moderado) | 150-600 €/mes según modelos |
| Con Ollama local | Hardware amortizado + electricidad; API solo para picos |
La comparación con las alternativas licenciadas la tienes en cuánto cuesta un ChatGPT corporativo para una empresa y, si valoras Gemini, en cuánto cuesta Gemini para empresas.
Las 4 piezas que faltan para producción empresarial#
Este es el filtro honesto: el stack de arriba es un sábado de trabajo; producción en una empresa con datos de clientes añade:
- Permisos por documento: LibreChat tiene RAG plano; en una empresa, un comercial no debe poder preguntar sobre las nóminas. Hay que construir ACL sobre la colección vectorial.
- Citas verificables: en legal o fiscal, una respuesta sin página de origen no sirve. Requiere RAG con referencias reforzado, no el de serie.
- Observabilidad de calidad (no solo coste): evals automáticos sobre las respuestas para detectar degradaciones al cambiar de modelo.
- Soporte y SLA: cuando el proxy cae un jueves a las 9:00, alguien tiene que tenerlo en producción — y no es el becario que lo montó.
Si tu equipo tiene los skills y el caso es acotado, montadlo vosotros con esta guía — es una gran manera de aprender. Si toca documentación confidencial, más de 20 usuarios y un director que pide "¿esto está funcionando?", es el proyecto que hago en Javadex: primero el diagnóstico del proceso, luego la plataforma con tu marca, tus datos en Europa y todos los modelos en una interfaz, en torno a un mes.
→ Cuéntame qué quieres montar →
Preguntas frecuentes#
¿LibreChat y LiteLLM son gratis?#
Sí, ambos son open source. El coste real es el servidor (20-60 €/mes), el consumo de API de los modelos y — si es para una empresa — las horas de mantenimiento: SSO, backups, actualizaciones y permisos.
¿Puedo usar modelos locales (Ollama) junto a Claude y GPT en LibreChat?#
Sí, y es el uso más inteligente del proxy: Ollama para los volúmenes altos y modelos locales por privacidad, y los modelos de frontera para lo que lo merece. LiteLLM rutea entre ellos y aplica fallback si uno cae.
¿Es legal usar LibreChat con datos de clientes en España?#
Montado en servidores propios (o en la UE) con modelos que no entrenan con tus datos, es el escenario más limpio que existe: tus datos no salen de tu infraestructura. La parte delicada no es LibreChat sino dónde apunta el proxy y qué retención tiene cada proveedor — se configura y se documenta.
¿Cuánto tarda montarlo un desarrollador?#
Un prototipo funcional con 3 modelos y RAG básico, una tarde. Con SSO, roles, backups y presupuestos por equipo, 2-5 días. La versión empresarial completa (permisos por documento, citas, evals, soporte), un mes.
¿Es mejor esto que ChatGPT Enterprise?#
Depende de lo que pagues con qué: Enterprise da governance y SSO en un par de clics, pero ~60 $/usuario/mes con mínimo de ~150 licencias. LibreChat + LiteLLM cuesta la infraestructura más el consumo, te deja usar todos los modelos en una interfaz y no te ata a un proveedor. Para pymes españolas de 5-50 personas, la balanza casi siempre cae del lado propio.

