Saltar al contenido
GRUPO ORO

Un chatbot en tu web que responde solo con tus documentos

Monta un asistente que contesta desde tu documentación real, cita la fuente, dice que no sabe cuando no sabe y deriva a una persona.

Tiempo
6 h el montaje; 2 semanas de afinado con preguntas reales
Nivel
avanzado
Coste
Desde 0 € de licencia si lo autoalojas más 10-20 €/mes de servidor; 40-150 $/mes si usas una plataforma cerrada; súmale 5-30 €/mes de API del modelo

Introducción

Un distribuidor industrial de Málaga tiene 900 referencias, cada una con su ficha técnica en PDF, y un equipo de tres personas en atención al cliente que se pasa el día respondiendo lo mismo: qué caudal da esta bomba, qué recambio lleva este modelo, cuál es el plazo de entrega. La información existe y está publicada, pero está en 900 PDF que nadie va a leer.

Un chatbot con recuperación de documentos resuelve justo eso: el usuario pregunta en lenguaje normal, el sistema busca los fragmentos relevantes en tu documentación, se los pasa al modelo y este redacta la respuesta citando de dónde sale. La diferencia con un ChatGPT genérico es que no responde de memoria: responde de tus papeles, y si no están, lo dice.

Es el tutorial más exigente de la serie porque el 70 % del trabajo no es técnico: es preparar los documentos y decidir qué pasa cuando el sistema no sabe. Un chatbot que se inventa una especificación técnica no es un chatbot malo, es un problema de responsabilidad. Vamos a montarlo con los frenos puestos desde el principio.

Para quién es: Para empresas con documentación de verdad: manuales, catálogos técnicos, condiciones, base de conocimiento de soporte. Si toda tu información cabe en una página de preguntas frecuentes, no montes esto: pon esa página bien y ahorra el proyecto.

Lo que necesitas antes de empezar

  • Documentación en formato digital y razonablemente actualizada; si tus PDF son escaneos, antes hay que pasarles OCR
  • Un servidor propio si vas a autoalojar, o una cuenta en una plataforma cerrada si prefieres no mantener nada
  • Clave de API de un modelo de lenguaje con facturación activa
  • Acceso al código de tu web para insertar el widget
  • Una lista de 30 a 50 preguntas reales de clientes con su respuesta correcta: es tu banco de pruebas
  • Alguien responsable de revisar semanalmente lo que el bot no supo responder

Paso a paso

  1. Paso 01

    Define el alcance y la fuente de verdad

    Decide qué temas cubre el asistente y de qué documento sale cada respuesta. Si una información está en dos sitios con versiones distintas, el sistema responderá cualquiera de las dos y tendrás un problema. Antes de tocar nada, resuelve las contradicciones de tu documentación: el chatbot las va a sacar a la luz todas.

    Truco: Empieza por un solo ámbito, por ejemplo fichas técnicas de una familia de producto. Un chatbot que responde diez cosas muy bien vale más que uno que responde cien regular.

  2. Paso 02

    Prepara los documentos: aquí se juega el resultado

    Convierte a texto limpio, elimina cabeceras, pies y menús repetidos, pon un título claro a cada documento y añade la fecha de vigencia dentro del texto. Las tablas son el punto débil: una tabla de especificaciones convertida a texto plano se vuelve ilegible para el modelo, así que conviértelas a una lista de pares campo-valor o a Markdown.

    Truco: Si un documento no lo entiende un humano leyendo solo ese fragmento, tampoco lo entenderá el modelo. Ese es el criterio con el que hay que revisar todo el corpus.

  3. Paso 03

    Elige montaje propio o plataforma cerrada

    Una plataforma tipo Chatbase te da un chatbot en una tarde: subes documentos, copias el widget y listo, a cambio de una cuota mensual y de que tus datos vivan fuera. Una plataforma autoalojada como Dify te da control total, coste de licencia cero y los datos en tu servidor, a cambio de mantenerla tú. Con documentación sensible o mucho volumen, la segunda; para validar la idea rápido, la primera.

    Truco: Valida la idea con la opción rápida durante un mes antes de invertir seis horas en el montaje propio. Si el chatbot no lo usa nadie, te has ahorrado el proyecto entero.

  4. Paso 04

    Crea la base de conocimiento y ajusta el troceado

    El sistema parte tus documentos en fragmentos y los indexa. Los valores por defecto (trozos de unas 500 palabras con algo de solape) funcionan para texto corrido, pero no para fichas técnicas, donde conviene que cada ficha o cada tabla sea un fragmento completo. Activa el reordenamiento de resultados si la plataforma lo ofrece: mejora bastante la precisión.

    Truco: Prueba a buscar directamente en la base de conocimiento, sin el modelo de por medio. Si la búsqueda no devuelve el fragmento correcto, ningún prompt lo va a arreglar: el problema está en el troceado.

  5. Paso 05

    Escribe el prompt de sistema con los frenos puestos

    Las instrucciones deben decir: responde únicamente con la información de los fragmentos recuperados; si no está, di que no tienes ese dato y ofrece contacto humano; cita el documento de origen; no calcules ni deduzcas especificaciones; no des precios que no aparezcan literalmente. Define también el tono y la longitud máxima.

    Truco: Pide que cada respuesta incluya el nombre del documento de origen. Además de dar confianza al usuario, te permite detectar de un vistazo cuándo el sistema está tirando del documento equivocado.

  6. Paso 06

    Evalúa con tu banco de 30-50 preguntas

    Pasa la lista entera y puntúa cada respuesta: correcta, incompleta, inventada o no respondida. Las inventadas son las graves y deben ser cero antes de publicar. Cambia una sola cosa cada vez (el troceado, el número de fragmentos recuperados, el prompt, el modelo) y vuelve a pasar la lista para saber qué ha mejorado de verdad.

    Truco: Incluye a propósito preguntas cuya respuesta NO esté en tus documentos. Lo que quieres comprobar es que dice que no sabe, que es justo lo que ningún demo enseña.

  7. Paso 07

    Dale acciones con n8n

    Un chatbot que solo lee documentos se queda corto. Conecta n8n por webhook para lo que requiere consultar o escribir en tus sistemas: estado de un pedido, stock real, crear un ticket o agendar una llamada. El modelo decide cuándo llamar a esa herramienta y con qué datos, y n8n hace el trabajo contra tu ERP o tu CRM.

    Truco: Cualquier acción que escriba en un sistema real necesita una confirmación explícita del usuario antes de ejecutarse. Un bot que crea pedidos porque ha malinterpretado una frase es un incidente, no una anécdota.

  8. Paso 08

    Publícalo en la web cuidando el RGPD

    Inserta el widget, ponle un saludo que diga qué sabe y qué no, y avisa de que es un asistente automático. En el aviso legal y en la política de privacidad, indica que las conversaciones se procesan con un proveedor de IA, cuánto se conservan y con qué finalidad. Pide al usuario que no escriba datos personales o de salud en el chat, y no guardes lo que no necesites.

    Truco: Mete un limitador de mensajes por sesión y por dirección IP. Sin eso, alguien puede lanzar miles de preguntas contra tu widget y la que paga la API eres tú.

  9. Paso 09

    Monta el bucle de mejora semanal

    Media hora cada semana revisando las conversaciones: las preguntas sin responder son tu lista de documentación pendiente, y las respuestas incorrectas indican fallos de troceado o de prompt. Mide el porcentaje de resueltas sin intervención humana y la evolución de los correos y llamadas de soporte, que es el ahorro real.

    Truco: Guarda cada corrección en tu banco de pruebas. Al cabo de tres meses tendrás 150 preguntas verificadas, y eso es lo que te permite cambiar de modelo sin miedo cuando salga uno mejor y más barato.

Qué tienes al terminar

Tienes un asistente en tu web que responde con tu documentación real, cita la fuente, admite cuando no sabe y puede consultar tus sistemas. Y un proceso de evaluación que te dice objetivamente si mejora o empeora cada vez que lo tocas.

Errores que vemos siempre

  • Subir los documentos tal cual y esperar buenos resultados. La calidad del corpus determina el techo del sistema; ningún modelo caro arregla una documentación desordenada.
  • No tener banco de pruebas. Sin él, cada ajuste es una opinión y nadie sabe si el chatbot va mejor o peor que la semana pasada.
  • Permitir que el bot responda cuando no encuentra información. Es la única vía por la que un chatbot documental se inventa cosas, y se cierra con el prompt y con un umbral mínimo de relevancia.
  • Montarlo y olvidarlo. Sin revisión semanal, el chatbot envejece con la documentación y acaba dando condiciones y precios caducados.

Y después

Cuando funcione en la web, lleva el mismo motor a los canales donde ya te escriben tus clientes (WhatsApp, el correo de soporte, el chat interno del equipo) y añade un panel con las preguntas más frecuentes sin respuesta: es la mejor lista de tareas de contenido que vas a tener.

Preguntas frecuentes

¿Por qué no subo mis PDF a ChatGPT y ya está?

Sirve para uso interno y para probar, pero no para tu web: no controlas el prompt ni los frenos, no puedes medir la calidad de forma sistemática, no se integra con tus sistemas y los documentos quedan en manos de un tercero sin que tú decidas la retención. Para un asistente público hace falta montarlo.

¿Cuánto cuesta mantenerlo al mes?

Autoalojado: un servidor pequeño de 10-20 €/mes y lo que consuma la API del modelo, que con unos cientos de conversaciones suele quedarse por debajo de 30 €/mes usando un modelo de gama media. En plataforma cerrada, los planes útiles arrancan alrededor de 40 $/mes y suben rápido con el volumen de mensajes.

¿Cómo evito que se invente respuestas?

Con tres capas: el prompt que prohíbe responder fuera de los fragmentos, un umbral mínimo de relevancia por debajo del cual no se responde, y la obligación de citar el documento de origen. No se elimina el riesgo al cien por cien, por eso ningún dato crítico (precio firme, especificación de seguridad) debe darse sin enlace al documento.

¿Qué modelo conviene usar?

En este montaje, la mayor parte del trabajo lo hace la búsqueda, no el modelo. Un modelo de gama media bien alimentado responde igual de bien que el más caro y cuesta una fracción. Reserva el modelo grande para las consultas que requieren razonar sobre varios documentos a la vez.

Actualizado el 16 de septiembre de 2026.