MedCite:语言模型能否生成可验证的医学文本?
计算与语言
2025-06-10 v1 人工智能
摘要
现有的基于 LLM 的医学问答系统缺乏引用生成和评估功能,这引发了在实际应用中采纳的顾虑。本文引入了 \name,这是第一个面向医学任务设计和评估引用生成的端到端框架。同时,我们引入了一种新颖的多 pass 检索-引用方法,可生成高质量引用。我们的评估突显了医学任务中引用生成的挑战与机遇,同时确定了对最终引用质量具有显著影响的重要设计选择。我们的方法在引用精确率和召回率方面均优于强大的基线方法,我们还展示了评估结果与来自专业专家的标注结果之间存在很好的相关性。
引用
@article{arxiv.2506.06605,
title = {MedCite: Can Language Models Generate Verifiable Text for Medicine?},
author = {Xiao Wang and Mengjue Tan and Qiao Jin and Guangzhi Xiong and Yu Hu and Aidong Zhang and Zhiyong Lu and Minjia Zhang},
journal= {arXiv preprint arXiv:2506.06605},
year = {2025}
}