OpenAlex database: Todo lo que necesitas saber
FECHA : 29/05/2026
HORARIO: 12:30 – 14:00
IDIOMA : Español
Profesores:
- Estás viendo la parte de Daniel Torres-Salinas
- María Verónica Forchino
- Wenceslao Arroyo-Machado
OPENALEX
Sobre el Curso
Este curso es una sección del curso que hemos dado en yosigo. Si te interesa no te olvide nuestros materiales, googlea los siguientes títulos: (1) «The OpenAlex database in review: Evaluating its applications, capabilities, and limitations»; (2) «Las ‘Big Three’ de la información científica: Revisión bibliométrica comparativa de Web of Science, Scopus y OpenAlex»
Punto de partida: no pensar OpenAlex como una base de datos clásica
Lo primero que conviene dejar claro es que OpenAlex no debe abordarse con la expectativa de encontrar una réplica de Web of Science o Scopus. El enfoque es distinto: más abierto, más modular, más minimalista en la interfaz y mucho más dependiente de que el usuario entienda bien qué campo está interrogando, qué filtros activa y qué implicaciones metodológicas tiene cada decisión.
Eso significa que no basta con «buscar y ya está». En OpenAlex, una parte importante del trabajo consiste en construir el corpus con criterio. La selección de un campo de búsqueda, la activación de XPAC, la elección de un filtro temático o institucional, o el uso de una colección personalizada modifican de forma real el universo documental recuperado.
Qué se puede buscar: entidades y tipos de objetos
OpenAlex permite buscar distintas entidades del ecosistema científico. No se limita a los documentos, sino que organiza la información en torno a objetos conectados entre sí:
- Works: artículos, libros, capítulos, preprints, datasets, software y otros productos de investigación.
- Authors: autores desambiguados.
- Sources: revistas, repositorios, series y otras fuentes.
- Institutions: universidades, centros de investigación, hospitales, etc.
- Topics / Keywords / Concepts / Funders y otros tipos: según la ruta de acceso y la parte de la interfaz o de la API en la que trabajemos.
La interfaz inicial: pocos campos, pero muy estratégicos
En la pantalla inicial de búsqueda vemos menos campos que en las bases de datos tradicionales. Esa aparente pobreza es engañosa: OpenAlex concentra la entrada textual en unos pocos puntos y desplaza buena parte de la potencia analítica al filtrado posterior.
En términos generales, el sistema permite buscar en estos ámbitos de texto:
- Title
- Abstract
- Title & Abstract
- Full text (cuando existe texto completo indexado)
La lógica aquí es importante. La búsqueda inicial en OpenAlex suele ser más simple, pero el refinamiento posterior es mucho más decisivo.
stemming: existe y hay que entenderlo bien
Reduce palabras a una raíz aproximada para ampliar la recuperación. Además, elimina palabras vacías o stop words en muchas consultas. En la documentación se explica, por ejemplo, que una búsqueda de possums también puede devolver possum y que el sistema trabaja con palabras completas, no con fragmentos arbitrarios.
Dicho de forma sencilla, el stemming intenta que una búsqueda no dependa demasiado de una sola flexión morfológica. En un contexto docente, esto se puede explicar así: si el motor considera que varias formas comparten la misma raíz conceptual, tenderá a reunirlas en los resultados. Esto mejora el recall (recuperación), pero a veces reduce precisión.
Búsqueda booleana clásica
OpenAlex admite búsqueda booleana clásica con AND, OR y NOT, en mayúsculas o minúsculas, y también frases entre comillas.
Ejemplo básico:
Altmetrics AND Overton
Si los términos no están separados por operadores, OpenAlex los trata como una conjunción implícita, es decir, como si hubiese un AND entre ellos.
También es útil advertir que las búsquedas booleanas muy largas tienen un límite práctico porque la URL de consulta ronda los 4 KB de longitud. En revisiones sistemáticas o estrategias muy extensas, puede ser necesario dividir la consulta en bloques y luego unir resultados fuera del sistema.
Búsqueda semántica con IA
Después de la búsqueda léxica clásica aparece otra posibilidad muy relevante: la búsqueda semántica. OpenAlex la plantea como un modo de recuperación por significado, no solo por coincidencia literal de términos. La documentación describe search.semantic como una búsqueda basada en embeddings de IA, adecuada para localizar trabajos conceptualmente relacionados aunque el vocabulario no coincida exactamente. En fin, resumiendo el asunto:
| Aspecto | Búsqueda Booleana | Búsqueda semántica AI |
|---|---|---|
| Lógica | Coincidencia de términos | Similitud de significado |
| Sintaxis | Booleanos, frases, operadores | Lenguaje natural o formulación conceptual |
| Ventaja principal | Precisión y control | Descubrimiento y expansión temática |
| Uso ideal | Estrategias cerradas y reproducibles | Exploración, descubrimiento, ampliación de vocabulario |
La búsqueda semántica puede ser muy útil para explorar un tema, pero no sustituye automáticamente a una estrategia booleana bien diseñada cuando necesitamos trazabilidad metodológica.
XPAC: expansión del corpus y cambio de escala
En OpenAlex aparece además el indicador o activador XPAC, que remite a una gran ampliación del corpus. La documentación pública de OpenAlex describe XPAC como un «expansion pack» que añadió 192 millones de nuevos works al índice. También lo puedes encontrar en la literatura como Walden
¿Qué entra ahí?
- Todo DataCite: datasets, software, preprints y otros objetos gestionados en ese ecosistema.
- Miles de repositorios institucionales y temáticos de todo el mundo.
La consecuencia es muy importante: OpenAlex pasa de un corpus ya enorme a uno muy loco, ampliando sobre todo literatura gris, productos no convencionales y materiales de repositorio.
Un ejemplito de andar por casa
- •
Altmetrics AND Overtonsin XPAC: 49 resultados - •
Altmetrics AND Overtoncon XPAC: 67 resultados
Esto muestra muy bien que activar o no XPAC cambia el resultaod. Esta no es una decisión técnica menor, sino una decisión metodológica que debe quedar documentada en cualquier investigación.
Zona derecha: filtros visibles y visión de conjunto
Como vemos en la zona derecha, se despliegan algunos filtros ya sugeridos por el sistema. Esta parte cumple una doble función: por un lado ofrece una visión rápida de la colección que tenemos delante; por otro, permite empezar a refinarla sin necesidad de reconstruir la consulta desde cero. También funcionan o podrían funcionar rollo cuadro de mando para los jefones.
Esta zona es especialmente importante porque OpenAlex, aunque potentísimo, tiene niveles de curación desiguales según el tipo de registro, la procedencia y el uso de XPAC. Precisamente por eso el filtrado fino resulta fundamental para «afinar» la búsqueda y construir un corpus más coherente. Sin afinar los resultados de OpenAlex pueden apestar (pareado).
| # | Categoría | Descripción | Nº de filtros |
|---|---|---|---|
| 1 | Aboutness | Filtros temáticos: dominio, campo, subcampo, palabras clave, tópico, ODS | 7 |
| 2 | Author | Filtros sobre autoría: autor, número de autores, autor correspondiente | 3 |
| 3 | Source | Filtros sobre la fuente de publicación: revista, tipo, editorial, acceso abierto en fuente, DOAJ, CWTS | 7 |
| 4 | Funder | Filtros sobre financiación: financiador, convocatorias/premios | 2 |
| 5 | Institution | Filtros institucionales: institución, tipo, institución correspondiente, número de instituciones | 4 |
| 6 | Geo | Filtros geográficos: país, continente, número de países, Sur Global, idioma | 5 |
| 7 | Open Access | Filtros de acceso abierto: estado OA, licencia, PDF disponible, OA aceptado, OA publicado | 6 |
| 8 | Citation | Filtros de impacto y citas: recuento, percentil, FWCI, referencias, trabajos relacionados | 6 |
| 9 | IDs | Filtros por identificadores: DOI, ORCID, PubMed, MAG, fuentes de indexación | 5 |
| 10 | Other | Otros filtros: tipo, año, resumen, título, retractado, afiliación, APC, colección, fechas | 13 |
Si pinchamos en el icono de cuadrados de la parte superior derecha, podemos generar una especie de cuadro de mandos o vista agregada o como deciamos de cuadros de mando. Por defecto suele activarse con filtros como:
- Year
- Open access
- Institution type
- Topic
- Funder
La utilidad: permite transformar una búsqueda en una primera lectura analítica de la colección y no solo en una lista de registros estática.
Ejemplos útiles para bibliometría
- • Búsqueda:
bibliometricsobibliometric analysis - • Filtro: Has a DOI = true
- • Filtro: Linked to a PDF = true
- • Filtro: Type = article
DORA AND COARA
- • Filtros: Source type = journal · Type = article · Year (período reciente)
"research evaluation" OR bibliometrics OR scientometrics
- • Filtros: Country = Spain · Type = article · Language = Spanish/English · Source type = journal
bibliometrics
- • Filtros: Type = dataset · activar XPAC para mayor cobertura de DataCite
Bibliometrics AND "open access"
→ Devuelve ~2049 resultados. Permite mostrar simultáneamente consulta, marcado y gestión por colecciones de forma ágil.
Selección, marcado y colecciones
Junto a las opciones de filtrado encontramos la posibilidad de marcar registros individualmente mediante la casilla clásica de selección. Una vez marcados, los registros pueden incorporarse a colecciones personalizadas
Ordenación de resultados
Por defecto, los resultados se ordenan por relevancia. La relevance_score combina similitud textual con el peso de citación del documento, de modo que los trabajos más citados tienden a ganar visibilidad en igualdad de condiciones de coincidencia léxica. Despues la opción es ordenador por algún tipo de indicador bibliométricos, es decir por nuestro impacto bibliométrico de toa la vida. Evidentemente es el mejor criterio para localizar información relevante y unida a los filtros forman un team top.
- Filtrar por últimos cinco años.
- Limitar a article y temática concreta.
- Ordenar por citas.
- Guardar la selección como colección específica.
Resultado: una colección de «artículos más citados en bibliometría evaluativa en los últimos cinco años», dejando claro que es una selección puramente funcional, no un canon absoluto.
Descargas y exportaciones
Las descargas pueden hacerse de manera modular a partir de la vista actual de resultados. Los formatos disponibles se adaptan a distintas necesidades analíticas:
| Formato | Descripción |
|---|---|
| CSV optimizado para Excel | Compatibilidad de codificación máxima, algo menos de riqueza de campos. |
| CSV estándar | Más columnas, arrays internos y datos complejos, mejor para tratamiento en R/Python. |
| EndNote / RIS | Formato de intercambio directo para gestores bibliográficos como Zotero o EndNote. |
| Text | Formato textual estructurado simple. |
Una vez lanzada la exportación, OpenAlex prepara el archivo en segundo plano y avisa cuando está listo:
«Your export is running now. You can track your export’s progress in Settings → Exports.»
⚠ Nota de acceso: Si no estamos logueados en la plataforma, algunas descargas (especialmente las de las facetas de la zona derecha) no están disponibles. Para descargar desde la zona derecha es obligatorio estar identificado.
Perfil del usuario y opciones de gestión
Desde el perfil personal, un bibliómetra o estudiante avanzado dispone del panel de control de sus recursos:
- API key: Clave única para peticiones de uso programático y scripts en Python o R.
- Saved searches: Acceso a consultas archivadas para monitorización.
- Alerts: Configuración de alertas de novedades sobre temas concretos.
- Collections: Consulta y depuración de colecciones creadas por marcado.
- Exports: Seguimiento y descarga de los paquetes generados con anterioridad.
El modelo de precios por uso (desde feb. 2026)
En febrero de 2026, OpenAlex introdujo un sistema de usage-based pricing para regular el uso intensivo de su API pública. El plan base gratuito para investigadores y estudiantes incluye un crédito de $1.00 USD diario, el cual es más que suficiente para flujos normales:
| Tipo de operación | Límite diario estimado con $1.00 |
|---|---|
Búsquedas directas (search) |
~1,000 consultas de texto libre |
Consultas filtradas estructuradas (filter) |
~10,000 llamadas a la API |
| Resultados exportados de datos | 100,000 a 1,000,000 de registros bibliográficos |
El presupuesto gratuito asignado se reinicia cada 24 horas de forma automática.
¿Esto restringe el acceso abierto? No. El sitio web oficial de consulta, el volcado completo de datos (CC0 Data Snapshot) y los esquemas de metadatos siguen siendo completamente gratuitos y sin coste. El sistema de cobro afecta principalmente al uso programático automatizado que sature el servidor.
🔑 Clave para optimización de proyectos de investigación:
Realizar peticiones mediante el operador de búsqueda textual (search) cuesta aproximadamente 10 veces más créditos que usar consultas basadas en filtros estructurados (filter). Para scripts de extracción masiva, conviene parametrizar filtros exactos siempre que sea posible en lugar de cadenas de texto libre.
Coda final
«Debido a la gran cantidad de basura académica que hay en OpenAlex, cualquier usuario, indepedientemente de que sea estudiante, profesor o conserje, no debería centrarse solo en cómo buscar en un estilo clásico, sino en cómo construir, previamente y dedicándole unos minutillos, un corpus de forma consciente y responsable. Es necesario saber que ocurre, qué pasa, qué hemos cocinado en los resultados, que nos devuelve nuestra búsqueda. ¿Qué fuentes? ¿Qué revistas? ¿Que repositorios?. Además tendremos que saber luego que filtros vamos a aplicar.»