中文

MedPAIR:医学问答中衡量医生与 AI 的相关性对齐

计算与语言 2025-06-02 v1 人工智能

摘要

大型语言模型(LLM)在各种医学问答(QA)基准测试中表现出色,包括标准化医学考试。然而,仅有正确答案并不能保证逻辑正确,模型可能会通过有缺陷的过程得出准确结论。在本研究中,我们引入了 MedPAIR(Medical Dataset Comparing Physicians and AI Relevance Estimation and Question Answering)数据集,以评估实习医生和 LLM 在回答 QA 问题时如何优先处理相关信息。我们获得了 36 名实习医生对 1,300 个 QA 对的标注,对问题组件中的每个句子的相关性进行标记。我们将这些相关性估计与 LLM 的相关性估计进行比较,并进一步评估这些“相关”子集对实习医生和 LLM 下游任务性能的影响。我们发现,LLM 经常与实习医生的内容相关性估计不一致。在过滤掉实习医生标记为不相关的句子后,实习医生和 LLM 的准确率均有提高。所有 LLM 和实习医生标记的数据可在以下网址获取:http://medpair.csail.mit.edu/。

关键词

引用

@article{arxiv.2505.24040,
  title  = {MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering},
  author = {Yuexing Hao and Kumail Alhamoud and Hyewon Jeong and Haoran Zhang and Isha Puri and Philip Torr and Mike Schaekermann and Ariel D. Stern and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2505.24040},
  year   = {2025}
}