AI辅助医学文献检索中的错误:比较研究
信息检索
2026-03-25 v1 机器学习
应用统计
统计方法学
摘要
大语言模型(LLM)辅助文献检索可能导致引用错误,但此类错误尚未得到严格量化。因此,我们量化评估了广泛使用的免费版LLM平台在引用检索中的错误,并确定了检索错误相关的因素。我们评估了来自英国医学杂志(BMJ)、美国医学会医学期刊(Journal of the American Medical Association)和《新英格兰医学杂志》(The New England Journal of Medicine,NEJM)2024年1月至2025年7月发表的40篇原文文章(每期10篇),由5个LLM(Grok-2、ChatGPT GPT-4.1、Google Gemini Flash 2.5、Perplexity AI和DeepSeek GPT-4)检索的2000条参考文献。主要结果为结合数字对象标识符、PubMed ID、Google Scholar链接及相关性的多指标得分比率;以及完全遗漏率(所有适用指标均失败的参考文献比例)。采用多变量回归分析检验独立关联。LLM平台完全未能正确检索参考数据的错误发生率为47.8%。5个LLM平台的平均得分比率为0.29(标准差0.35;范围0-1.25),得分比率越高表明检索相关参考文献和正确书目数据的准确性越高。Grok获得最高准确率(0.57),Gemini获得最低准确率(0.11)。与BMJ相比,NEJM文章的得分比率更低且完全遗漏率更高。多变量分析显示,LLM平台和期刊与得分比率及完全遗漏率均呈独立相关。我们显示LLM整体表现有限,不同平台和期刊间检索准确性存在显著差异。LLM平台和期刊与LLM在医学文献检索中的表现相关。使用LLM辅助文献检索时,应仔细审阅书目数据。
引用
@article{arxiv.2603.22344,
title = {Errors in AI-Assisted Retrieval of Medical Literature: A Comparative Study},
author = {Jenny Gao and Yongfeng Zhang and Mary L Disis and Lanjing Zhang},
journal= {arXiv preprint arXiv:2603.22344},
year = {2026}
}