agosto 2026

¿Qué necesitamos para construir un buscador IA sobre una colección documental?

Logo del proyecto DOCUMENTALIA

En la entrada anterior presentamos el proyecto DOCUMENTALIA y explicamos su propósito: formular preguntas en lenguaje natural sobre una colección de artículos científicos y obtener respuestas fundamentadas en los documentos recuperados. Ahora vamos a mirar dentro de este sistema.

Un buscador de este tipo no se construye simplemente conectando una colección de artículos de revista almacenados en PDF o XML-JATS con un modelo IA. Entre los documentos originales y la respuesta final existe una cadena de procesos que permite extraer, organizar, representar y recuperar la información. Un buscador IA sobre una colección documental necesita de un corpus documental, mecanismos de extracción y estructuración de información, un sistema de almacenamiento, una estrategia de fragmentación, una representación semántica de los contenidos, un sistema de recuperación y un modelo de lenguaje que genere la respuesta a partir de las evidencias recuperadas. DOCUMENTALIA utiliza precisamente esta arquitectura.

Arquitectura general de Documentalia

De los documentos a la respuesta

La secuencia reflejada en la figura representa, de forma general, la arquitectura del sistema que vamos a construir: Corpus → extracción → estructuración → base de datos → fragmentación → embeddings → recuperación → modelo de lenguaje → respuesta con fuentes. Esta arquitectura proporciona el mapa de lo que iremos construyendo. Algunas partes ya están desarrolladas cuando escribimos esta entrada en este cuaderno de bitácora, otras corresponden a fases aun inexploradas. Veamos qué función cumple cada componente de DOCUMENTALIA.

1. Corpus: definir sobre qué documentos queremos preguntar

Todo comienza con una colección documental o corpus que, en nuestro proyecto, la constituyen inicialmente los artículos de Anales de Documentación y Cuadernos de Gestión de Información. No son documentos creados expresamente para realizar el experimento, sino publicaciones reales ya editadas (algunas van camino de los 30 años) bajo distintas condiciones editoriales (los rimeros números de Anales de Documentación solo tenían edición impresa pero pronto pasamos a disponer de la digital y, desde hace ya bastante tiempo, sólo de la digital). Esto introduce un primer problema: el corpus no es homogéneo. Se dispone, mayoritariamente de documentos en formato PDF y también en XML-JATS (correspondientes a los últimos número de Anales de Documentación), revista pionera en nuestra universidad en esta cuestión junto con Anales de Psicología). Los primeros conservan principalmente la presentación visual del artículo y los segundo contienen información estructurada mediante etiquetas; los segundos y serán los que se irán añadiendo a DOCUMENTALIA a partir de ahora.

c
Vista de un artículo en formato XML-Jats en la revista Anales de Documentación

Por tanto, antes de pensar en aplicar la inteligencia artificial, es preciso saber qué documentos tenemos y qué podemos extraer de ellos.

2. Extracción: convertir documentos en datos

El siguiente componente es el parser. En recuperación de información es el programa encargado de interpretar los documentos y extraer la información que necesitamos. En un artículo científico queremos reconocer elementos como: título, autores, afiliaciones, fecha, revista, volumen, número, identificadores, resúmenes, palabras clave, secciones y referencias bibliográficas.

El problema a abordar es diferente según el formato. En los artículos que están ya redactados en XML-JATS, por ejemplo, una etiqueta puede indicar explícitamente que determinado texto corresponde al título o a un autor. En los documentos escritos en PDF (la gran mayoría), esa estructura debe ser reconstruida a partir del contenido y de determinadas regularidades documentales.

Cuestiones a resolver

Hay que tener presente que extraer el texto de un documento no implica haber extraído su estructura ni haber identificado correctamente la información que contiene. Esta cuestión ha ocupado la mayor parte del tiempo dedicado al proyecto en las primeras fases y será objeto de las próximas entradas.

3. Estructuración: representar documentos diferentes de una forma común

Los documentos originales pueden representar una misma información de maneras distintas. Un artículo puede disponer de DOI, otro, de handle; otro puede aportar los dos identificadores permanentes (eso sería lo deseable aunque, de momento, el repositorio de la Universidad de Murcia no devuelve el handle en la consulta por algún tipo de protección de seguridad), puede presentar tres resúmenes hasta en diferentes idiomas (es frecuente en los artículos escritos por autores brasileños); una reseña tiene una estructura completamente diferente de un artículo de investigación. Necesitamos transformar esa diversidad en una representación común.

Así entendido, la estructuración y normalización documental consiste en organizar la información extraída conforme a un modelo estable, independientemente de cómo estuviera originalmente representada. Gracias a ello, DOCUMENTALIA puede tratar de forma coherente artículos procedentes de diferentes formatos y épocas.

4. Base de datos: conservar la estructura del corpus

La información normalizada se almacena en una base de datos relacional creada al principio del proyecto con MySQL. En ella no guardamos únicamente una sucesión de textos, representamos entidades y relaciones: revistas, artículos, autores, afiliaciones, resúmenes, palabras clave, secciones, referencias e identificadores. Esto permite saber, por ejemplo, qué autores pertenecen a un artículo, qué resúmenes tiene, qué secciones hemos reconocido o qué DOI y handle permiten identificarlo. La base de datos y la futura búsqueda semántica cumplen, por tanto, funciones diferentes: la base de datos conserva la estructura conocida de la colección y la búsqueda semántica permite localizar información por su significado. Ambas formas de representación serán necesarias.

5. Fragmentación: dividir para recuperar mejor

Un artículo científico completo es una unidad demasiado grande para responder con precisión a una pregunta concreta (un artículo puede tratar varios temas y/o cuestiones). Si la información relevante está contenida en dos párrafos de un documento de veinte páginas, necesitamos ser capaces de recuperar esos párrafos y no necesariamente el artículo completo. Para ello dividiremos el contenido en fragmentos o chunks. El proceso de fragmentar persigue crear unidades de texto adecuadas para la recuperación: suficientemente pequeñas para ser precisas y suficientemente amplias para conservar el contexto. En una colección científica surge además una posibilidad interesante: aprovechar la propia estructura del artículo —introducción, metodología, resultados, discusión, conclusiones— para realizar una fragmentación más informada que un simple corte cada determinado número de palabras. Esta será una de las decisiones que tendremos que evaluar experimentalmente.

6. Embeddings: representar semánticamente los fragmentos

Una vez creados los fragmentos necesitamos una forma de comparar su significado con el de las preguntas formuladas por los usuarios, Aquí aparecen los embeddings (representación numérica de un contenido textual que permite comparar computacionalmente su proximidad semántica con otros textos).

Esquema del proceso de embeddings: fragmentos de un artículo científico se transforman en vectores numéricos que permiten comparar y recuperar textos por su significado semántico.
¿Qué es un embeding?

De manera simplificada, a un fragmento de texto se le aplica un modelo de embeddings para producir un vector. A la pregunta del usuario se le ha de aplicar el mismo procedimiento (tal como hace el modelo tf-idf en la RI clásica). De esta forma, tendremos dos vectores (representaciones) que se van a comparar para localizar fragmentos relacionados con una pregunta aunque no utilicen exactamente las mismas palabras. Es importante precisar qué los embeddings no responden a la pregunta, sino que ayudan a localizar qué partes del corpus pueden contener la respuesta.

7. Recuperación: encontrar las evidencias

El siguiente componente selecciona, entre todos los fragmentos disponibles, aquellos más relevantes para la consulta. La proximidad entre embeddings puede constituir uno de sus mecanismos, pero no tiene por qué ser el único, se puede combinar búsqueda semántica con términos, metadatos, fechas, revistas u otros criterios de la búsqueda clásica.

Esquema del proceso de recuperación semántica: una pregunta se compara con los fragmentos del corpus, se seleccionan las evidencias más relevantes y se envían al modelo de lenguaje para generar la respuesta.
Esquema del proceso de recuperación semántica

La calidad de esta fase es crítica. Un modelo de lenguaje difícilmente podrá construir una respuesta correctamente fundamentada si previamente le proporcionamos fragmentos irrelevantes. Por ello, DOCUMENTALIA tendrá que evaluar dos cuestiones diferentes: (1) ¿hemos recuperado las evidencias adecuadas? y (2) el modelo ha respondido correctamente utilizando esas evidencias?

Separar ambas preguntas permitirá localizar mejor dónde se produce un posible error. No debemos olvidar que la recuperación no genera la respuesta: selecciona los fragmentos del corpus que pueden contener la información necesaria.

8. Modelo de lenguaje: generar la respuesta

Solo después de recuperar información necesaria interviene el modelo de lenguaje o LLM. El mismo recibe la pregunta junto con los fragmentos seleccionados y genera una respuesta utilizando ese contexto documental. Se puede resumir en:

Modelo LLM: pregunta + fragmentos recuperados → LLM → respuesta

La función del modelo no es sustituir al sistema de recuperación, sino interpretar y sintetizar las evidencias que este ha localizado. En DOCUMENTALIA añadimos una condición esencial: la respuesta debe mantener la relación con los artículos de los que procede la información.

9. Respuesta con fuentes: cerrar el círculo documental

El resultado que buscamos no es simplemente un texto generado, aspiramos a obtener una respuesta trazable, acompañada de las fuentes utilizadas para construirla y, siempre que sea posible, con acceso al artículo correspondiente. Esto permite al usuario pasar de la respuesta generada al documento original y comprobar la evidencia. En una aplicación sobre artículos científicos como es nuestro proyecto, esta trazabilidad es especialmente importante porque la respuesta no debe convertirse en el punto final de la búsqueda, sino en una nueva vía de acceso a los documentos (artículos científicos) que contienen el conocimiento recuperado.

Hay componentes que atraviesan toda la arquitectura

El esquema de DOCUMENTALIA incorpora además varias capas transversales.

  • El control de calidad debe comprobar que la extracción y normalización son correctas.
  • Los identificadores persistentes mantienen la identidad y trazabilidad de los documentos.
  • El registro y la monitorización permiten conocer qué ocurre durante los procesos automáticos y localizar incidencias.

Finalmente, la ética y la transparencia afectan al sistema completo: procedencia de la información, trazabilidad de las fuentes, tratamiento de los documentos y uso responsable de los modelos de inteligencia artificial. No son etapas que ocurran al final, son requisitos que acompañan a todo el proceso.

No todo es inteligencia artificial

En la anterior entrada ya hacíamos mención a esta cuestión, reincidimos en ella. La arquitectura general del proyecto permite extraer una primera conclusión: no se trata únicamente de un problema de inteligencia artificial, es también un problema de gestión documental, representación de información, bases de datos y recuperación de información.

No todo es IA en DOCUMENTALIA

Antes de que un modelo de lenguaje pueda generar una respuesta habrá que seleccionar los documentos, interpretarlos, estructurar su información, almacenarla, dividir su contenido, representarlo y recuperar las evidencias adecuadas. La IA generativa ocupa una posición importante en la arquitectura, pero depende de todo lo que ocurre antes. Esta perspectiva es especialmente relevante en DOCUMENTALIA porque queremos comprobar hasta qué punto esta arquitectura puede reutilizarse con otras colecciones: repositorios institucionales, revistas, tesis doctorales, informes técnicos, colecciones patrimoniales o bibliotecas digitales.

¿Por dónde empezamos?

Se puede decir que ya disponemos del mapa general, toca ahora comenzar a recorrerlo de izquierda a derecha. El primer obstáculo apareció muy pronto: los artículos de las revistas no tienen todos la misma estructura ni están disponibles en el mismo formato de fichero. El gran problema han sido las maquetaciones, aspecto que podría parecer insignificante ante la potencia de la tecnología LLM, se ha convertido en un problema, tanto por los cambios de plantilla como por los muchos fallos a la hora de editar los artículos (es difícil encontrar tres o cuatro seguidos «bien maquetados»). Muchas formas de escribir en la Ciencia han cambiado con los años, también ha cambiado la norma para las referencias bibliográficas y existen artículos de investigación, reseñas, editoriales y otros tipos de documentos.

Por tanto, antes de construir embeddings o conectar un modelo de lenguaje, ha habido que resolver una cuestión mucho más básica: ¿cómo convertir una colección de documentos heterogéneos en un corpus estructurado que una máquina pueda interpretar de forma consistente?

Con suerte, lo podremos explicar en la siguiente entrada.

DOCUMENTALIA: buscador IA para revistas científicas

logotipo de DOCUMENTALIA

Los buscadores de las plataformas que alojan a las revistas científicas permiten localizar artículos localizando títulos, autores, palabras clave o términos presentes en los documentos. Pero, ¿qué ocurre si queremos hacer una pregunta sobre el contenido de una colección («documentos sobre comportamiento informacional«, por ejemplo) y obtener una respuesta elaborada a partir de los artículos publicados en esas revistas? Necesitaríamos un buscador IA con más capacidades.

DOCUMENTALIA es un proyecto experimental para desarrollar un buscador basado en inteligencia artificial sobre el texto completo de revistas científicas (Anales de Documentación y Cuadernos de Gestión de Información en este caso, dos de las revistas editadas por nuestra facultad y en las que participamos en el comité editorial. El objetivo de este proyecto es que el usuario pueda formular preguntas en lenguaje natural y recibir respuestas construidas a partir de los documentos de la colección, manteniendo siempre la posibilidad de identificar y consultar las fuentes utilizadas (tanto los artículos publicados en estas dos revistas como las referencias en las que se han basado los autores).

Cabecera de Anales de Documentación y de Cuadernos de Gestión de Información en el portal de revistas de la Universidad de Mucia
Cabeceras de las dos revistas indexadas en el proyecto DOCUMENTALIA

A lo largo de esta serie de entradas iremos explicando paso a paso cómo estamos construyendo el sistema, los problemas encontrados y las soluciones adoptadas.

¿Por qué construir un buscador con IA para una revista científica?

Un buscador convencional suele responder bien a una pregunta del tipo: «¿Qué artículos contienen el término «preservación digital»?«. Sin embargo, resulta algo más complicado utilizarlo para responder a preguntas como: «¿Qué problemas relacionados con la preservación digital han estudiado los artículos publicados en la revista?» (aunque el «modo IA» de Google puede matizar esta afirmación). La diferencia es importante: de forma habitual se buscan documentos que contienen determinadas palabras, con la ayuda de la IA intentaremos recuperar información relevante, relacionarla y generar una respuesta fundamentada en los documentos recuperados.

Aquí es donde entran en juego los sistemas de recuperación aumentada mediante generación ‘Retrieval-Augmented Generation‘ de los que hablamos en un post anterior. Esta tecnología combina dos procesos:

  1. Recuperación de información: localizar de forma selectiva dentro de una colección los documentos o fragmentos más relacionados con la pregunta.
  2. Generación de la respuesta: un modelo de lenguaje utiliza la información recuperada como contexto para elaborar la respuesta.

En DOCUMENTALIA vamos a añadir una tercera exigencia: la trazabilidad, entendida bajo el paradigma de que una respuesta sobre literatura científica solo resulta verdaderamente útil si podemos saber qué documentos sustentan la información proporcionada.

¿Qué queremos conseguir?

El objetivo se representa en un esquema muy simple: Pregunta del usuario → búsqueda en los artículos → recuperación de evidencias → generación de la respuesta → identificación de las fuentes

Esquema básico del funcionamiento de DOCUMENTALIA
Esquema básico del funcionamiento de Documentalia

Nuestro proyecto de buscador no pretende entrenar un nuevo modelo IA con los artículos de estas revistas. El planteamiento es diferente porque se aspira a construir una infraestructura que permita a un modelo consultar una colección documental previamente procesada y recuperar de ella la información necesaria para responder a una pregunta. Esta distinción va a ser muy importante durante todo el proyecto.

Sorpresa: el verdadero problema empieza antes de la IA

Cabe pensar que la parte más complicada consiste en conectar los documentos con un modelo de lenguaje, pero no es así. Antes de llegar a ese punto necesitamos responder a preguntas mucho más elementales:

  • ¿Qué documentos forman el corpus?
  • ¿En qué formatos se encuentran editadas?
  • ¿Siguen todas las mismas plantillas a lo largo de los años de edición de las revistas (Anales de Documentación tiene casi 30 años de antigüedad). ¿Los editores y/o los autores han respetado las plantillas y las normas editoriales?
  • ¿Cómo extraemos de los artículos títulos, autores, resúmenes, palabras clave, secciones y referencias?
  • ¿Cómo identificamos inequívocamente cada artículo?
  • ¿Cómo almacenamos toda esa información?
  • ¿Cómo comprobamos que la extracción ha sido correcta?
  • ¿Qué parte del contenido debemos proporcionar posteriormente al sistema de recuperación?

El paso del tiempo no es cuestión baladí. Una revista científica evoluciona. Los artículos más recientes de Anales de Documentación se editan en PDF y XML-JATS, y presentan una estructura muy regular, mientras que buena parte del corpus solo está disponible en PDF y el diseño editorial, la estructura de los artículos y las normas bibliográficas han cambiado durante los años (se pasó de ISO 690 a APA hace unos años). La otra revista, que aporta menos artículos porque sólo se editó durante unos años, tiene normas de formato diferentes sustancialmente, otra dificultad añadida. Por ello, antes de construir el buscador hay que convertir un conjunto documental heterogéneo en un corpus estructurado, normalizado y susceptible de ser procesado automáticamente.

La elección de un corpus real nos lleva a enfrentarnos a problemas que difícilmente aparecen en una demostración construida con unos pocos documentos:

  • documentos PDF y XML-JATS
  • artículos publicados en diferentes épocas
  • textos en español, portugués e inglés
  • artículos de investigación, reseñas y otros tipos documentales
  • diferentes estructuras y diseños de página
  • cambios en los sistemas de identificación de los documentos (hoy en día nadie discute el uso del DOI, identificador que no existía hasta hace unos años)
  • distintas formas de presentar autores, afiliaciones, resúmenes, palabras clave y referencias bibliográficas.

Esta heterogeneidad convierte nuestras dos revistas en un buen laboratorio para estudiar cómo construir sistemas de recuperación con IA sobre colecciones científicas reales.

Un proyecto que explicaremos paso a paso

Esta entrada inicia una serie en la que documentaremos el desarrollo de DOCUMENTALIA desde la preparación de los documentos hasta la construcción y evaluación del buscador. El proceso puede resumirse inicialmente en varias etapas: Corpus → extracción → estructuración → base de datos → fragmentación → embeddings → recuperación → modelo de lenguaje → respuesta con fuentes

Arquitectura general de DOCUMENTALIA
Arquitectura general de Documentalia

En las próximas entradas comentaremos (o lo intentaremos al menos) qué ocurre en cada una de estas etapas, prestando especial atención a los problemas encontrados, porque algunas de las decisiones más interesantes del proyecto han ido surgiendo precisamente cuando los documentos reales no se comportaban como esperábamos (lo que ha ocurrido más frecuentemente de lo deseado).

¿Puede aplicarse este procedimiento a otras colecciones?

Comònentes a desarrollar en documentalia
Documentalia: componentes a desarrollar

Ese es uno de los objetivos de esta serie de entradas: transferir el conocimiento adquirido. Buena parte de los problemas que estamos abordando en nuestro proyecto con dos revistas aparecen también al trabajar con repositorios institucionales, colecciones digitalizadas, revistas históricas, tesis doctorales, informes técnicos o bibliotecas digitales. Por eso no queremos presentar únicamente el resultado final, vamos a documentar el proceso de construcción y explicar qué decisiones pueden reutilizarse en otros proyectos.

En la siguiente entrada partiremos de una pregunta básica: ¿qué componentes necesitamos realmente para construir un buscador IA sobre una colección documental?

Gracias a ChatGPT

Logo de chatgpt

El desarrollo de DOCUMENTALIA cuenta con ChatGPT como asistente en las distintas fases del proyecto, no como sustituto de las decisiones de diseño, programación y validación. La interacción con el modelo se ha utilizado para analizar la estructura de documentos reales, diseñar y depurar los parsers de XML-JATS y PDF, interpretar errores, proponer modificaciones del código, definir el modelo de datos, establecer procedimientos de validación y documentar las sucesivas decisiones adoptadas. El proceso es deliberadamente iterativo: (1) se seleccionan documentos del corpus; (2) se ejecutan los programas desarrollados; (3) se contrastan sus resultados con los documentos originales y (4) los errores detectados sirven para plantear nuevas correcciones y pruebas. Esta forma de trabajo convierte la IA generativa en una herramienta de apoyo a la programación, análisis y resolución de problemas bajo supervisión humana, mientras que el corpus, los criterios de validación y las decisiones finales permanecen bajo control del responsable del proyecto.