¿Quién hará las revisiones sistemáticas del futuro? La IA, la democratización del conocimiento y la responsabilidad científica

Nuestra visión del mundo está determinada por nuestro conocimiento. Las personas con las que nos relacionamos y todas las que se han cruzado en nuestro camino, los libros que hemos leído, la prensa que ojeamos, las series que devoramos, las redes sociales que nos atrapan, los artículos científicos que hemos leído… En definitiva, nuestras experiencias y la forma en que las procesamos determinan cómo entendemos y nos relacionamos con el mundo. En investigación ocurre exactamente lo mismo.

Solo podemos formular preguntas a partir de los conocimientos que hemos adquirido, y la producción científica es tal que hoy por hoy es imposible alcanzar una perspectiva global sin dejar nada fuera. Las revisiones sistemáticas llevan décadas tratando de sintetizar este conocimiento, desarrollando un proceso metodológico altamente protocolizado para favorecer la reproducibilidad y la transparencia, y permitir a los investigadores y al mundo obtener una visión global del estado del conocimiento sobre una pregunta concreta.

Desde el principio, las herramientas digitales que se fueron incorporando a la síntesis de evidencia buscaron reducir la carga de trabajo y optimizar las distintas fases que dan forma a toda revisión sistemática:

  • Búsqueda de literatura (Carrot2, CitationChaser, ResearchRabbit…)
  • Gestión de la literatura (EndNote, Zotero, Mendeley…)
  • Cribado por título y resumen (ASReview, Abstrackr, Rayyan, Colandr, Covidence, DistillerSR, EPPI-Reviewer…)
  • Extracción de datos (Cochrane_scraper, Colandr, Covidence, ExaCT…)
  • Evaluación de calidad (AMSTAR checklist, DistillerSR, Covidence, Eppi-Reviewer, RobotReviewer…)

Si bien siempre hubo herramientas que buscaban mejorar la generación de preguntas de investigación, la redacción del protocolo o la redacción y discusión de conclusiones, ha sido la llegada de la IA generativa la que ha supuesto una revolución al permitir dialogar directamente con la bibliografía. ChatGPT, Copilot, Gemini, Perplexity, Claude, Elicit, Nested Knowledge, SciSpace, Anara, PaperGuide, Consensus, Jenni AI, Petal… permiten no solo refinar preguntas de investigación y estructurarlas mediante marcos como PICO cuando procede, sino también interactuar con la literatura científica utilizando lenguaje natural. En ese sentido, dejan de ser simples aplicaciones para convertirse en auténticos asistentes de investigación.

Pese a todos estos cambios, o quizá por ahora, la irrupción de la IA generativa no ha transformado el flujo metodológico de las revisiones sistemáticas, que continúa guiado por los estándares de JBI, Cochrane, Campbell o PRISMA, pero sí está empezando a ejecutar parte de las tareas que tradicionalmente recaían sobre los revisores. Ya no se trata solo de la automatización de tareas, sino de quién asume la responsabilidad sobre decisiones metodológicas en las que estos nuevos asistentes ya empiezan a intervenir: ayuda en la formulación de preguntas PICO o PCC, definición de criterios de inclusión y exclusión, elaboración de protocolos preliminares, definición de variables, extracción de datos, elaboración de libros de codificación, redacción de resultados.

Además, los desarrollos recientes están reduciendo una complejidad técnica y metodológica que durante años supuso una importante barrera de entrada. Ya no es necesario programar ni dedicar semanas a aprender el funcionamiento de múltiples aplicaciones especializadas. Del mismo modo, parte del conocimiento metodológico imprescindible para desarrollar una buena revisión sistemática comienza a estar integrado en estos nuevos asistentes. Las nuevas plataformas cuentan con interfaces conversacionales intuitivas que reducen la carga cognitiva, estructuran las distintas fases de una síntesis de evidencia y acercan procesos metodológicos complejos a investigadores con menor experiencia.

La IA no solo está cambiando cómo se hacen las revisiones sistemáticas; está cambiando quién puede hacerlas.

Imagen de vectorjuice en Magnific

Elicit, DistillerSR, Rayyan, Nested Knowledge, Laser AI… son solo algunas de las herramientas que integran funcionalidades que abarcan gran parte del flujo metodológico de las síntesis de evidencia, aunque no fueron las primeras. En realidad, la idea de integrar todo el proceso no es nueva. Plataformas como CADIMA, Parsifal, ReLiS o JBI SUMARI ya perseguían ese objetivo hace años. La diferencia es que la nueva generación incorpora IA generativa, interfaces conversacionales y agentes especializados.

Sin embargo, la adopción de esta nueva generación de herramientas todavía carece de un consenso claro. Más allá de las recomendaciones generales sobre el uso responsable de la inteligencia artificial publicadas por organizaciones como Cochrane, JBI, Campbell o la APA, la elección de una herramienta suele depender de las preferencias del investigador, los recursos disponibles o la inclinación metodológica del equipo hacia aquellas plataformas cuya eficacia y fiabilidad han sido evaluadas de forma independiente. En el momento de escribir estas líneas, Cochrane tiene en marcha el proyecto CESAR para evaluar de forma comparativa distintas herramientas de IA destinadas a la síntesis de evidencia. Sus resultados probablemente marcarán un punto de inflexión en la adopción de estas tecnologías, especialmente en aquellos contextos donde la evidencia metodológica resulta determinante, y contribuirán a consolidar marcos de uso responsable como los principios RAISE.

Ahora la pregunta es si llegará un punto en el que la IA se equipare en fiabilidad a las revisiones humanas y el tiempo y esfuerzo de supervisar no compense, llegando a lo que se denomina sesgo de automatización. ¿Llegará el momento en el que sustituyamos los dos revisores humanos por dos LLM independientes? ¿Llegaremos a ceder todo el control metodológico? ¿Conservaremos entonces la autoría y la responsabilidad de las conclusiones?

Aunque quizá ese momento no esté tan lejos. Por ejemplo, entre los asistentes generales de investigación encontramos al «agente de revisión de literatura» de PaperGuide, que permite generar una revisión automatizada del estado de la cuestión (actualmente limitada a unas 50 referencias) a partir de una única pregunta de investigación. El asistente propone un protocolo inicial, identifica estudios en bases de datos como PubMed, arXiv, OpenAlex, Semantic Scholar o la bibliografía que se le entregue, criba los artículos, extrae información relevante y genera una síntesis estructurada. No se trata todavía de una revisión sistemática realizada conforme a los estándares metodológicos de JBI o PRISMA, pero sí de un claro indicio de la dirección en la que evoluciona el ecosistema. Elicit, SciSpace o Anara, cuentan con funcionalidades similares: haces la pregunta de investigación y la herramienta te devuelve un resumen a partir de una cantidad determinada de bibliografía, en función del paquete contratado. Los asistentes especializados en síntesis de evidencia como Elicit Systematic Review o Rayyan ResearchPilot ofrecen mayor control y alcance en cuanto a cantidad de literatura, pero la promesa es la misma: más rápido, más fácil.

La naturaleza altamente protocolizada de las revisiones sistemáticas las ha convertido en una candidata ideal para la automatización. Esta evolución permitirá que equipos de investigación pequeños, e incluso estudiantes, puedan abordar revisiones con un rigor metodológico que hasta hace pocos años requería muchos más recursos. Sin embargo, esa democratización también nos obliga a preguntarnos hasta dónde estamos dispuestos a delegar el control metodológico. La tendencia natural del ser humano a minimizar el esfuerzo, y los sesgos como el de automatización o complacencia frente a la automatización, parecen señalar ya una dirección.

Precisamente por ello, la responsabilidad científica de los investigadores deberá seguir siendo la principal garantía de que la síntesis de evidencia generada —con independencia del grado de automatización— cumple los principios de reproducibilidad, transparencia y rigor que sustentan una revisión sistemática. Quizá, por ello, el gran debate de los próximos años ya no sea si la inteligencia artificial puede hacer una revisión sistemática, sino quién asumirá la responsabilidad cuando sea ella quien la haga mejor que nosotros.

Nota metodológica. La elaboración de este artículo siguió un proceso iterativo que evolucionó desde una revisión exploratoria del estado de la cuestión y del ecosistema actual de herramientas hacia una reflexión sobre el impacto de la inteligencia artificial en la síntesis de evidencia. La revisión bibliográfica se amplió progresivamente mediante búsqueda por referencias y citación (snowballing). Tras la redacción de un primer borrador, se utilizó ChatGPT como asistente para la discusión crítica de ideas y para la revisión gramatical, ortográfica y de estilo. La selección de la bibliografía, la interpretación de la evidencia, las conclusiones y la versión final del manuscrito son responsabilidad exclusiva del autor.

Referencias:

Abogunrin, S., Liu, Y., & Zerbini, C. H. (2026). A systematic literature review (SLR) on the adoption of artificial intelligence-assisted SLRS: Implications for health technology assessments. International Journal of Technology Assessment in Health Care, 42(1), e29. https://doi.org/10.1017/S0266462326103535

Bolaños, F., Salatino, A., Osborne, F., & Motta, E. (2024). Artificial intelligence for literature reviews: Opportunities and challenges. Artificial Intelligence Review, 57(10), 259. https://doi.org/10.1007/s10462-024-10902-3

Call for proposals: AI tools to transform evidence synthesis | Cochrane. (s. f.). Recuperado 2 de julio de 2026, de https://www.cochrane.org/about-us/news/call-proposals-ai-tools-transform-evidence-synthesis

Carey, N., Harte, M., & Cullagh, L. M. (2022). A text-mining tool generated title-abstract screening workload savings: Performance evaluation versus single-human screening. Journal of Clinical Epidemiology, 149, 53-59. https://doi.org/10.1016/j.jclinepi.2022.05.017

Cierco Jimenez, R., Lee, T., Rosillo, N., Cordova, R., Cree, I. A., Gonzalez, A., & Indave Ruiz, B. I. (2022). Machine learning computational tools to assist the performance of systematic reviews: A mapping review. BMC Medical Research Methodology, 22(1), 322. https://doi.org/10.1186/s12874-022-01805-4

Cochrane lanza un estudio para evaluar si la inteligencia artificial puede mejorar las revisiones de salud | Cochrane Iberoamérica. (s. f.). Recuperado 8 de julio de 2026, de https://es.cochrane.org/es/news/cochrane-lanza-un-estudio-para-evaluar-si-la-inteligencia-artificial-puede-mejorar-las

dos Reis, A. H. S., de Oliveira, A. L. M., Fritsch, C., Zouch, J., Ferreira, P., & Polese, J. C. (2023). Usefulness of machine learning softwares to screen titles of systematic reviews: A methodological study. Systematic Reviews, 12(1), 68. https://doi.org/10.1186/s13643-023-02231-3

Flemyng, E., Noel‐Storr, A., Macura, B., Gartlehner, G., Thomas, J., Meerpohl, J. J., Jordan, Z., Minx, J., Eisele‐Metzger, A., Hamel, C., Jemioło, P., Porritt, K., & Grainger, M. (s. f.). Position statement on artificial intelligence (AI) use in evidence synthesis across Cochrane, the Campbell Collaboration, JBI and the Collaboration for Environmental Evidence 2025 | Cochrane Library. Recuperado 2 de julio de 2026, de https://www.cochranelibrary.com/cdsr/doi/10.1002/14651858.ED000178/full

Fütterer, T., Campos, D. G., Gfrörer, T., Lavelle-Hill, R., Murayama, K., & Scherer, R. (2026). AI tools for systematic literature reviews and meta-analyses in educational psychology: An overview and a practical guide. Learning and Individual Differences, 126, 102849. https://doi.org/10.1016/j.lindif.2025.102849

Ge, L., Agrawal, R., Singer, M., Kannapiran, P., De Castro Molina, J. A., Teow, K. L., Yap, C. W., & Abisheganaden, J. A. (2024). Leveraging artificial intelligence to enhance systematic reviews in health research: Advanced tools and challenges. Systematic Reviews, 13(1), 269. https://doi.org/10.1186/s13643-024-02682-2

Harasgama, S., Pearce, H., Appel, C., Loftus, L., Painter, H., Kuhn, I., Karpusheff, J., Ceesay, A., & Ford, J. (2026). Artificial Intelligence Tools for Automating Evidence Synthesis: Scoping Review. Journal of Medical Internet Research, 28, e81597. https://doi.org/10.2196/81597

Harrison, H., Griffin, S. J., Kuhn, I., & Usher-Smith, J. A. (2020). Software tools to support title and abstract screening for systematic reviews in healthcare: An evaluation. BMC Medical Research Methodology, 20(1), 7. https://doi.org/10.1186/s12874-020-0897-3

Johnson, E. E., O’Keefe, H., Sutton, A., & Marshall, C. (2022). The Systematic Review Toolbox: Keeping up to date with tools to support evidence synthesis. Systematic Reviews, 11, 258. https://doi.org/10.1186/s13643-022-02122-z

Lagisz, M., Mizuno, A., Morrison, K., Pollo, P., Ricolfi, L., Yang, Y., & Nakagawa, S. (2026). Using Elicit AI research assistant for data extraction in systematic reviews: A feasibility study across environmental and life sciences. Research Synthesis Methods, 1-18. https://doi.org/10.1017/rsm.2026.10080

Rathbone, J., Hoffmann, T., & Glasziou, P. (2015). Faster title and abstract screening? Evaluating Abstrackr, a semi-automated online screening program for systematic reviewers. Systematic Reviews, 4(1), 80. https://doi.org/10.1186/s13643-015-0067-6

Recommendations and guidance on responsible AI in evidence synthesis | Cochrane. (s. f.). Recuperado 2 de julio de 2026, de https://www.cochrane.org/events/recommendations-and-guidance-responsible-ai-evidence-synthesis

Reddy, S. M., Patel, S., Weyrich, M., Fenton, J., & Viswanathan, M. (2020). Comparison of a traditional systematic review approach with review-of-reviews and semi-automation as strategies to update the evidence. Systematic Reviews, 9(1), 243. https://doi.org/10.1186/s13643-020-01450-2

Schmidt, L., Cree, I., Campbell, F., & Group, W. E. M. (2025). Digital Tools to Support the Systematic Review Process: An Introduction. Journal of Evaluation in Clinical Practice, 31(3), e70100. https://doi.org/10.1111/jep.70100

Thomas, J., Flemyng, E., & Noel-Storr, A. (2024). Responsible use of AI in evidence SynthEsis (RAISE): Recommendations and guidance. https://osf.io/fwaud/overview

Wallace, B. C., Trikalinos, T. A., Lau, J., Brodley, C., & Schmid, C. H. (2010). Semi-automated screening of biomedical citations for systematic reviews. BMC Bioinformatics, 11(1), 55. https://doi.org/10.1186/1471-2105-11-55

Xu, S., Zhao, Z., Liu, X., & Meng, X. (2025). A comparative study of screening performance between abstrackr and GPT models: Systematic review and contextual analysis. BMC Medical Informatics and Decision Making, 25(1), 293. https://doi.org/10.1186/s12911-025-03138-w