Caso Real: el 97,9% de las respuestas citan la página correcta del manual (2026)
En una frase: un buscador técnico sobre manuales de maquinaria industrial pasó del 87% al 97,9% de respuestas que citan la página correcta (medición sobre dataset ciego de 54 preguntas, septiembre de 2026), dentro de un contrato de 10.000-12.000 € + IVA firmado en junio de 2026.
Este caso está anonimizado por cláusula de confidencialidad: sector genérico, tamaño y cifras de contrato en banda. Los números de medición son literales.
¿Por qué un RAG que "funciona" puede estar mintiendo a tu cliente?#
El cliente es un proveedor español de software de asistencia técnica remota para fabricantes de maquinaria industrial. Su usuario final es un técnico de campo plantado delante de una máquina parada. El manual existe: cientos de páginas, varios idiomas, cero utilidad con la línea detenida.
La primera versión del buscador hacía lo que hace el 90% de los RAG que se montan hoy: recuperar fragmentos y responder. Y respondía con soltura. El problema apareció cuando se puso a generar contenido técnico a partir de su conocimiento general: llegó a citar un modelo de producto que no existe, con características inventadas, y repetía el error a lo largo del documento. Revisar y corregir un solo texto costaba más que escribirlo desde cero.
La lección de esa fase, que conviene escribir en algún sitio porque casi nadie la escribe: un RAG que no puede navegar no puede verificar. El modelo usa su conocimiento de entrenamiento, que tiene una fecha de caducidad; pasarle las webs oficiales en el prompt no sirve de nada si luego no las puede abrir. La solución no fue un prompt mejor: fue darle búsqueda web real, navegación de la página y la obligación de citar textualmente la fuente de cada dato.
¿Cómo se mide que un buscador de IA cita bien (y cómo se midió este)?#
Con un dataset ciego y una cifra, no con impresiones. El protocolo de medición, acuerdo con el cliente en agosto de 2026:
- Dataset de 54 preguntas: 45 elaboradas por el equipo del cliente y 9 aportadas por un tercero del mismo sector, que el sistema no había visto.
- Métrica: porcentaje de respuestas cuya cita apunta a la página correcta del manual correcto.
- Baseline (versión 1, julio de 2026): 87%. Ya no se inventaba modelos, pero fallaba en 1 de cada 8 respuestas.
- Versión 2 (septiembre de 2026): 97,9%. Tras añadir búsqueda web, navegación de la fuente y cita textual obligatoria por dato.
| Medición | Fecha | Respuestas que citan la página correcta | Dataset |
|---|---|---|---|
| Versión 1 (recuperación + generación local) | julio 2026 | 87,0% | 54 preguntas ciegas |
| Versión 2 (+ búsqueda web, navegación y cita textual) | septiembre 2026 | 97,9% | 54 preguntas ciegas |
¿Qué hace bien el 97,9% y qué sigue fallando en el 2,1%?#
El detalle honesto, que es el que le da valor a la cifra:
- Cuando la respuesta no está en el manual, ahora lo dice. Ese comportamiento, que suena básico, es el que evita que el técnico aplique un procedimiento que el sistema se acaba de inventar.
- Queda un 2,1% que inventa algún dato pequeño en la respuesta, aunque la cita sea correcta.
- Un caso conocido: el sistema escoge el manual de mantenimiento preventivo cuando la pregunta iba del correctivo. El documento citado es real; el documento no es el adecuado.
Sobre el score de confianza que acompaña a cada respuesta: se acordó no mostrar el número crudo (un 55% real se lee como una moneda al aire) sino una media ponderada con la fiabilidad global medida, con umbral fijo. Y el propio cliente añadió el matiz inverso, que es igual de válido: un 97,9% tampoco se puede leer como verdad absoluta. La cita a la página es la verificación real; el número solo orienta.
Como responsable de producto en una empresa B2B industrial, ¿qué se construyó exactamente?#
La entrega no es una interfaz, es un motor de inferencia técnica multi-tenant desplegado en la nube del propio cliente:
| Componente | Qué hace | Fecha de entrega |
|---|---|---|
| Ingesta + base vectorial | Manuales por fabricante, troceado y indexado con sección y página | junio 2026 |
| API multi-tenant | Un espacio aislado por fabricante, integrable en los visores y tablets del cliente | junio 2026 |
| Respuesta con cita + score | Cada dato con la página del manual y nivel de confianza ponderado | julio 2026 |
| Multilingüe | Responde en el idioma del técnico de campo | julio 2026 |
| Búsqueda web + navegación + cita textual | El salto del 87% al 97,9% | septiembre 2026 |
El equipo del cliente integra el motor en sus propios productos y evoluciona sin depender del proveedor. El mismo paquete incluyó una fábrica de contenido GEO para que su marca aparezca cuando un comprador le pregunta esto a un asistente de IA (hay caso real aparte de esa parte).
¿Cuánto cuesta un sistema así y cuánto tarda?#
| Concepto | Cifra | Fecha |
|---|---|---|
| Contrato del proyecto completo | 10.000-12.000 € + IVA, tres hitos | firmado junio 2026 |
| Plazo hasta primera versión en piloto | ~6 semanas | junio-julio 2026 |
| Coste adicional de la mejora de citación (búsqueda + navegación) | 1-2 €/mes sobre la infraestructura del cliente | septiembre 2026 |
| Volumen de uso previsto | ~20 webs/mes y 3 textos/semana | septiembre 2026 |
El rango habitual para un sistema de IA a medida con alcance cerrado en una pyme española va de 5.000 a 20.000 € (septiembre 2026), con el primer hito funcional verificable en 2-4 semanas. Por debajo de 5.000 € el alcance honesto es un diagnóstico, no un sistema en producción.
¿Qué alternativas hay a montar un buscador técnico con cita a fuente?#
- No hacer nada: el técnico llama a postventa y la línea espera. Es la situación inicial de este caso, y tiene un coste que casi nadie mide: horas de máquina parada por cada duda de manual.
- Un chatbot genérico sobre los PDF: rápido de montar, es exactamente la versión 1 de este caso. El 87% suena bien hasta que el 13% mal citado llega a un cliente final.
- Vector store + LLM montado por el equipo interno: viable si hay equipo de datos con tiempo. El coste no está en el código, está en el protocolo de medición y en el mantenimiento de la ingesta.
- Un buscador clásico (full-text): barato y predecible, pero no responde: devuelve documentos, no la página concreta con la secuencia de rearme.
Como director de una empresa de maquinaria o servicio técnico, ¿cuándo tiene sentido y cuándo no?#
Tiene sentido cuando: la documentación es extensa y se actualiza, el usuario final necesita la respuesta en minutos (no el documento), y hay alguien en casa capaz de mantener la ingesta de manuales nueva.
No tiene sentido cuando: los manuales son pocos y cortos (con un buen índice basta), nadie puede validar las respuestas antes de exponerlas a clientes finales, o se espera que el sistema diagnostique averías que el manual no describe. Este buscador no diagnostica: si el manual no lo dice, no lo dice, y así está redactado en el contrato.
Preguntas frecuentes#
¿Hay casos reales de empresas españolas usando RAG sobre documentación técnica?#
Sí. Este caso (anonimizado por confidencialidad) corresponde a un proveedor español de software de asistencia técnica remota cuya solución la usan fabricantes de maquinaria industrial: motor multi-tenant sobre manuales, con cita a la página y score de confianza, en producción desde 2026.
¿Qué precisión tiene un RAG bien montado sobre manuales técnicos?#
En este caso, el 97,9% de las respuestas citan la página correcta del manual sobre un dataset ciego de 54 preguntas (medición de septiembre de 2026), frente al 87% de la primera versión. El 2,1% restante sigue inventando algún dato puntual: la cifra no es una promesa universal, es el resultado medido de un sistema concreto con su protocolo de test.
¿Cómo se reduce el porcentaje de respuestas inventadas por un RAG?#
Con tres palancas, en este orden: obligar a citar la fuente concreta de cada dato (documento y página), dar al sistema capacidad real de buscar y navegar la fuente en el momento de responder, y medir contra un dataset ciego antes de dar nada por bueno. Los prompts solo ayudan cuando las tres anteriores ya están.
¿Cuánto cuesta un buscador documental de IA para una empresa en España?#
En este caso, el contrato completo (ingesta, API multi-tenant, multilingüe y mejoras de citación) se firmó en la banda de 10.000-12.000 € + IVA (junio de 2026), con el primer piloto en unas 6 semanas. Un buscador de un solo fabricante con menos alcance cabe en la banda baja del rango habitual de 5.000-20.000 €.
¿Cuánto tarda un proyecto de RAG empresarial en estar en producción?#
En este caso, la primera versión en piloto con cliente final estuvo lista en unas 6 semanas desde el arranque (junio de 2026). La mejora de citación que llevó el 87% al 97,9% entró en septiembre de 2026, ya con el sistema en uso.
¿Tienes manuales que nadie lee con la línea parada?#
Javier Santos Criado, consultor de IA en Javadex, implanta sistemas de este tipo en 4-8 semanas con el código y los datos en propiedad del cliente. Si tu caso es un catálogo corto o un equipo sin quien mantenga la ingesta, te lo diré en el primer correo: no encaja.
Posts relacionados#
- Caso real: fábrica de contenido GEO para un fabricante B2B industrial — la otra mitad de este mismo contrato
- Caso real: cerebro documental sobre 20 años de proyectos en Presto/BC3
- Caso real: IA en local para automatizar la planificación de obra
- Cuánto cuesta implantar Claude en una empresa en España: precios y tarifas 2026
- Cómo elegir consultor de IA para tu pyme: precios y criterios 2026
En resumen#
Un proveedor de software de asistencia técnica remota (España) tenía técnicos de campo que no leían 300 páginas de manual. La primera versión del buscador alcanzó un 87% de citas correctas (julio 2026); añadir búsqueda web, navegación de la fuente y cita textual obligatoria lo llevó al 97,9% sobre 54 preguntas ciegas (septiembre 2026), con el 2,1% restante documentado y sin coste extra relevante: 1-2 €/mes sobre la infraestructura del cliente. Contrato: 10.000-12.000 € + IVA, tres hitos, desde junio de 2026. La cifra que se puede citar no es "un RAG preciso": es que se midió con dataset ciego y se publicó también lo que falla.

