El proyecto
El español no vive solo donde se habla desde siempre. Vive en los rótulos de un restaurante de Berlín, en el aula donde alguien aprende alemán desde el castellano, en las expresiones que dos lenguas se prestan sin pedir permiso.
Hispanoverso/DemIA reúne la investigación que documenta ese español en movimiento y la convierte en un recurso consultable: un catálogo abierto y una búsqueda que entiende preguntas en lenguaje natural.
De dónde nace
El GIR Hispanoverso de la Universidad de Salamanca trabaja sobre la comunicación digital y la proyección de la cultura hispana global. Este proyecto es su infraestructura de datos: pone en circulación lo que el grupo ha publicado durante una década.
Se enmarca además en la Cátedra Internacional en Inteligencia Artificial Fiable y Reto Demográfico (DemIA), que aborda la despoblación, el envejecimiento y la desigualdad territorial con inteligencia artificial explicable, desde una perspectiva ética y centrada en las personas.
La conexión entre ambos no es casual. La migración es la otra cara del reto demográfico: los territorios que se vacían y las comunidades hispanohablantes que se forman fuera son el mismo fenómeno visto desde dos orillas. Y la lengua es donde ese movimiento deja huella primero.
Qué contiene
144 publicaciones que abarcan de 2017 a 2026, en español, alemán e inglés.
El corpus recorre el contacto entre lenguas y su enseñanza, el paisaje lingüístico de las ciudades europeas, la fraseología contrastiva, el patrimonio cultural compartido y —cada vez más— el uso responsable de la inteligencia artificial en la formación de docentes de lenguas.
Predomina el capítulo de libro colectivo, seguido del artículo de revista. Es el perfil característico de la investigación filológica, y tiene una consecuencia práctica: la mayoría de estas publicaciones no aparecen en las bases de datos que asignan descriptores temáticos, y menos de un tercio tiene DOI.
Dicho de otro modo: es investigación valiosa y difícil de encontrar. Ese es exactamente el hueco que este proyecto viene a cubrir.
Cómo funciona
Cada noche, el sistema consulta el portal de producción científica de la Universidad de Salamanca y recoge los metadatos de cada publicación en formato BibTeX, un estándar de intercambio bibliográfico. Frente al raspado de páginas web, esa vía aporta datos ya estructurados y resiste los rediseños del portal.
Cuando una publicación tiene DOI, se completa con OpenAlex: resumen, disponibilidad en acceso abierto, enlace al documento y recuento de citas.
Después, cada publicación se convierte en una representación numérica de su contenido. Es lo que permite preguntar por significado: alguien puede escribir «¿cómo se enseña vocabulario técnico en clase de idiomas?» y encontrar trabajos relevantes aunque no compartan ni una palabra con la pregunta.
El catálogo se publica como páginas estáticas. Sin base de datos que consultar en cada visita, carga en milisegundos y los buscadores lo indexan sin fricción.
Cómo se organiza
Las publicaciones se reparten entre seis ejes temáticos: lenguas en contacto, paisaje lingüístico, didáctica de lenguas, migración y diáspora, patrimonio cultural, e inteligencia artificial y lenguaje.
La asignación se hace con reglas explícitas sobre el título, la publicación contenedora y las palabras clave cuando existen. El criterio es deliberadamente auditable: cualquiera puede examinar las reglas y entender por qué una publicación aparece bajo un eje.
Una parte del corpus queda sin clasificar. Es consecuencia directa de la escasez de metadatos descriptivos en el origen, y se documenta abiertamente en lugar de forzar una categoría que no corresponde.
Para quién
Para quien investiga y necesita saber qué se ha publicado ya sobre un asunto concreto.
Para quien enseña y busca materiales y referencias sobre didáctica de lenguas.
Para quien evalúa y quiere ver, de un vistazo, qué produce un grupo de investigación y cómo evoluciona.
Y para cualquiera con curiosidad por cómo viaja el español y qué le ocurre cuando se encuentra con otras lenguas.
Datos abiertos
Los metadatos bibliográficos se publican bajo licencia CC0 y son accesibles mediante una interfaz pública documentada. Los documentos originales conservan la licencia de sus editoriales.
El planteamiento coincide con el del Living Lab de DemIA: un espacio donde investigadores, instituciones y ciudadanía pueden usar, experimentar y descargar recursos digitales de forma abierta y gratuita.
El código fuente del sistema está disponible públicamente.