中文

LLM在引用相关医学参考文献方面表现如何?评估框架与分析

计算与语言 2024-02-06 v1 人工智能

摘要

大语言模型(LLM)目前正被用于回答各种临床领域的医学问题。尤其是近期表现顶尖的商业 LLM,还具备引用来源以支持其回答的能力。在本文中,我们提出一个问题:LLM 生成的来源是否真正支持它们所作的声明?为回答此问题,我们提出三项贡献。首先,由于专家医学标注是可扩展评估的昂贵且耗时的瓶颈,我们证明了 GPT-4 在验证来源相关性方面具有高度准确性,与医生专家组达成一致的比例达 88%。其次,我们开发了一个名为 \textit{SourceCheckup} 的端到端自动化流水线,并用它在 1200 个生成问题的数据集上评估了五个表现顶尖的 LLM,总计超过 4 万对声明与来源。有趣的是,我们发现约 50% 到 90% 的 LLM 回答并未被其提供的来源完全支持。我们还使用检索增强生成(RAG)评估了 GPT-4,发现即便如此,仍有约 30% 的单独声明不被支持,而近一半的回答未被完全支持。第三,我们开源了精心整理的医学问题与专家标注数据集,供未来评估使用。鉴于 LLM 发展的快速步伐以及错误或过时医学信息可能带来的危害,理解并量化其生成相关、可信医学参考文献的能力至关重要。

关键词

引用

@article{arxiv.2402.02008,
  title  = {How well do LLMs cite relevant medical references? An evaluation framework and analyses},
  author = {Kevin Wu and Eric Wu and Ally Cassasola and Angela Zhang and Kevin Wei and Teresa Nguyen and Sith Riantawan and Patricia Shi Riantawan and Daniel E. Ho and James Zou},
  journal= {arXiv preprint arXiv:2402.02008},
  year   = {2024}
}