Ir al contenido principal
Javadex

Caso Real [2026]: el 97,9% de las Respuestas Citan la Página Correcta del Manual

9 min

Un buscador técnico sobre manuales de maquinaria pasó del 87% al 97,9% de respuestas que citan la página correcta, medido sobre un dataset ciego de 54 preguntas. Contrato de 10.000-12.000 € + IVA, tres hitos. El 2,1% que falla también se publica.

Aplicarlo en mi empresa Diagnóstico de 30 min · sin compromiso
Índice del artículo11 secciones

Caso Real: el 97,9% de las respuestas citan la página correcta del manual (2026)

En una frase: un buscador técnico sobre manuales de maquinaria industrial pasó del 87% al 97,9% de respuestas que citan la página correcta (medición sobre dataset ciego de 54 preguntas, septiembre de 2026), dentro de un contrato de 10.000-12.000 € + IVA firmado en junio de 2026.

Este caso está anonimizado por cláusula de confidencialidad: sector genérico, tamaño y cifras de contrato en banda. Los números de medición son literales.

¿Por qué un RAG que "funciona" puede estar mintiendo a tu cliente?#

El cliente es un proveedor español de software de asistencia técnica remota para fabricantes de maquinaria industrial. Su usuario final es un técnico de campo plantado delante de una máquina parada. El manual existe: cientos de páginas, varios idiomas, cero utilidad con la línea detenida.

La primera versión del buscador hacía lo que hace el 90% de los RAG que se montan hoy: recuperar fragmentos y responder. Y respondía con soltura. El problema apareció cuando se puso a generar contenido técnico a partir de su conocimiento general: llegó a citar un modelo de producto que no existe, con características inventadas, y repetía el error a lo largo del documento. Revisar y corregir un solo texto costaba más que escribirlo desde cero.

La lección de esa fase, que conviene escribir en algún sitio porque casi nadie la escribe: un RAG que no puede navegar no puede verificar. El modelo usa su conocimiento de entrenamiento, que tiene una fecha de caducidad; pasarle las webs oficiales en el prompt no sirve de nada si luego no las puede abrir. La solución no fue un prompt mejor: fue darle búsqueda web real, navegación de la página y la obligación de citar textualmente la fuente de cada dato.

¿Cómo se mide que un buscador de IA cita bien (y cómo se midió este)?#

Con un dataset ciego y una cifra, no con impresiones. El protocolo de medición, acuerdo con el cliente en agosto de 2026:

  • Dataset de 54 preguntas: 45 elaboradas por el equipo del cliente y 9 aportadas por un tercero del mismo sector, que el sistema no había visto.
  • Métrica: porcentaje de respuestas cuya cita apunta a la página correcta del manual correcto.
  • Baseline (versión 1, julio de 2026): 87%. Ya no se inventaba modelos, pero fallaba en 1 de cada 8 respuestas.
  • Versión 2 (septiembre de 2026): 97,9%. Tras añadir búsqueda web, navegación de la fuente y cita textual obligatoria por dato.
MediciónFechaRespuestas que citan la página correctaDataset
Versión 1 (recuperación + generación local)julio 202687,0%54 preguntas ciegas
Versión 2 (+ búsqueda web, navegación y cita textual)septiembre 202697,9%54 preguntas ciegas

¿Qué hace bien el 97,9% y qué sigue fallando en el 2,1%?#

El detalle honesto, que es el que le da valor a la cifra:

  • Cuando la respuesta no está en el manual, ahora lo dice. Ese comportamiento, que suena básico, es el que evita que el técnico aplique un procedimiento que el sistema se acaba de inventar.
  • Queda un 2,1% que inventa algún dato pequeño en la respuesta, aunque la cita sea correcta.
  • Un caso conocido: el sistema escoge el manual de mantenimiento preventivo cuando la pregunta iba del correctivo. El documento citado es real; el documento no es el adecuado.

Sobre el score de confianza que acompaña a cada respuesta: se acordó no mostrar el número crudo (un 55% real se lee como una moneda al aire) sino una media ponderada con la fiabilidad global medida, con umbral fijo. Y el propio cliente añadió el matiz inverso, que es igual de válido: un 97,9% tampoco se puede leer como verdad absoluta. La cita a la página es la verificación real; el número solo orienta.

Como responsable de producto en una empresa B2B industrial, ¿qué se construyó exactamente?#

La entrega no es una interfaz, es un motor de inferencia técnica multi-tenant desplegado en la nube del propio cliente:

ComponenteQué haceFecha de entrega
Ingesta + base vectorialManuales por fabricante, troceado y indexado con sección y páginajunio 2026
API multi-tenantUn espacio aislado por fabricante, integrable en los visores y tablets del clientejunio 2026
Respuesta con cita + scoreCada dato con la página del manual y nivel de confianza ponderadojulio 2026
MultilingüeResponde en el idioma del técnico de campojulio 2026
Búsqueda web + navegación + cita textualEl salto del 87% al 97,9%septiembre 2026

El equipo del cliente integra el motor en sus propios productos y evoluciona sin depender del proveedor. El mismo paquete incluyó una fábrica de contenido GEO para que su marca aparezca cuando un comprador le pregunta esto a un asistente de IA (hay caso real aparte de esa parte).

¿Cuánto cuesta un sistema así y cuánto tarda?#

ConceptoCifraFecha
Contrato del proyecto completo10.000-12.000 € + IVA, tres hitosfirmado junio 2026
Plazo hasta primera versión en piloto~6 semanasjunio-julio 2026
Coste adicional de la mejora de citación (búsqueda + navegación)1-2 €/mes sobre la infraestructura del clienteseptiembre 2026
Volumen de uso previsto~20 webs/mes y 3 textos/semanaseptiembre 2026

El rango habitual para un sistema de IA a medida con alcance cerrado en una pyme española va de 5.000 a 20.000 € (septiembre 2026), con el primer hito funcional verificable en 2-4 semanas. Por debajo de 5.000 € el alcance honesto es un diagnóstico, no un sistema en producción.

¿Qué alternativas hay a montar un buscador técnico con cita a fuente?#

  • No hacer nada: el técnico llama a postventa y la línea espera. Es la situación inicial de este caso, y tiene un coste que casi nadie mide: horas de máquina parada por cada duda de manual.
  • Un chatbot genérico sobre los PDF: rápido de montar, es exactamente la versión 1 de este caso. El 87% suena bien hasta que el 13% mal citado llega a un cliente final.
  • Vector store + LLM montado por el equipo interno: viable si hay equipo de datos con tiempo. El coste no está en el código, está en el protocolo de medición y en el mantenimiento de la ingesta.
  • Un buscador clásico (full-text): barato y predecible, pero no responde: devuelve documentos, no la página concreta con la secuencia de rearme.

Como director de una empresa de maquinaria o servicio técnico, ¿cuándo tiene sentido y cuándo no?#

Tiene sentido cuando: la documentación es extensa y se actualiza, el usuario final necesita la respuesta en minutos (no el documento), y hay alguien en casa capaz de mantener la ingesta de manuales nueva.

No tiene sentido cuando: los manuales son pocos y cortos (con un buen índice basta), nadie puede validar las respuestas antes de exponerlas a clientes finales, o se espera que el sistema diagnostique averías que el manual no describe. Este buscador no diagnostica: si el manual no lo dice, no lo dice, y así está redactado en el contrato.

Preguntas frecuentes#

¿Hay casos reales de empresas españolas usando RAG sobre documentación técnica?#

Sí. Este caso (anonimizado por confidencialidad) corresponde a un proveedor español de software de asistencia técnica remota cuya solución la usan fabricantes de maquinaria industrial: motor multi-tenant sobre manuales, con cita a la página y score de confianza, en producción desde 2026.

¿Qué precisión tiene un RAG bien montado sobre manuales técnicos?#

En este caso, el 97,9% de las respuestas citan la página correcta del manual sobre un dataset ciego de 54 preguntas (medición de septiembre de 2026), frente al 87% de la primera versión. El 2,1% restante sigue inventando algún dato puntual: la cifra no es una promesa universal, es el resultado medido de un sistema concreto con su protocolo de test.

¿Cómo se reduce el porcentaje de respuestas inventadas por un RAG?#

Con tres palancas, en este orden: obligar a citar la fuente concreta de cada dato (documento y página), dar al sistema capacidad real de buscar y navegar la fuente en el momento de responder, y medir contra un dataset ciego antes de dar nada por bueno. Los prompts solo ayudan cuando las tres anteriores ya están.

¿Cuánto cuesta un buscador documental de IA para una empresa en España?#

En este caso, el contrato completo (ingesta, API multi-tenant, multilingüe y mejoras de citación) se firmó en la banda de 10.000-12.000 € + IVA (junio de 2026), con el primer piloto en unas 6 semanas. Un buscador de un solo fabricante con menos alcance cabe en la banda baja del rango habitual de 5.000-20.000 €.

¿Cuánto tarda un proyecto de RAG empresarial en estar en producción?#

En este caso, la primera versión en piloto con cliente final estuvo lista en unas 6 semanas desde el arranque (junio de 2026). La mejora de citación que llevó el 87% al 97,9% entró en septiembre de 2026, ya con el sistema en uso.

¿Tienes manuales que nadie lee con la línea parada?#

Cuéntame qué documentación consume tu equipo o tus clientes y te digo qué es medible y qué no — y si no tiene sentido, también

Javier Santos Criado, consultor de IA en Javadex, implanta sistemas de este tipo en 4-8 semanas con el código y los datos en propiedad del cliente. Si tu caso es un catálogo corto o un equipo sin quien mantenga la ingesta, te lo diré en el primer correo: no encaja.

Posts relacionados#

En resumen#

Un proveedor de software de asistencia técnica remota (España) tenía técnicos de campo que no leían 300 páginas de manual. La primera versión del buscador alcanzó un 87% de citas correctas (julio 2026); añadir búsqueda web, navegación de la fuente y cita textual obligatoria lo llevó al 97,9% sobre 54 preguntas ciegas (septiembre 2026), con el 2,1% restante documentado y sin coste extra relevante: 1-2 €/mes sobre la infraestructura del cliente. Contrato: 10.000-12.000 € + IVA, tres hitos, desde junio de 2026. La cifra que se puede citar no es "un RAG preciso": es que se midió con dataset ciego y se publicó también lo que falla.

¿Quieres un copiloto interno sobre TUS documentos?

Construyo un asistente con memoria sobre tu documentación: normativas, manuales, contratos, base de conocimiento. Tu equipo pregunta y recibe respuesta con cita a la fuente. RAG empresarial llave en mano. Desde 5.000€.

Quiero el copilotojavi@javadex.es
Javier Santos - Especialista en IA & Machine Learning

Javier Santos

Consultor de IA para empresas. Comparto contenido sobre inteligencia artificial, automatización y desarrollo cada semana.