中文

MedRedFlag:探究大语言模型如何在真实世界健康沟通中纠正误解

计算与语言 2026-04-21 v2 人工智能

摘要

来自患者的真实世界健康问题常常无意中嵌入了错误的假设或前提。在这种情况下,安全的医疗沟通通常涉及纠正:先处理隐含的误解,然后回应患者潜在的关切,而非直接回答原始问题。虽然大语言模型(LLMs)正越来越多地被非专业用户用于获取医疗建议,但它们尚未在这一关键能力上接受测试。因此,在这项工作中,我们探究了 LLMs 如何应对嵌入在真实世界健康问题中的错误前提。我们开发了一个半自动化流程来构建 MedRedFlag 数据集,该数据集包含 1100 多个来自 Reddit、需要纠正的问题。然后,我们系统性地比较了最先进的 LLMs 与临床医生的回答。我们的分析揭示,LLMs 常常未能纠正有问题的提问,即使检测到了有问题的前提,也会提供可能导致次优医疗决策的答案。我们的基准测试和结果揭示了 LLMs 在真实世界健康沟通条件下的一个新颖且显著的性能差距,突显了面向患者的医疗 AI 系统的关键安全隐患。代码和数据集可在 https://github.com/srsambara-1/MedRedFlag 获取。

关键词

引用

@article{arxiv.2601.09853,
  title  = {MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication},
  author = {Sraavya Sambara and Yuan Pu and Ayman Ali and Vishala Mishra and Lionel Wong and Monica Agrawal},
  journal= {arXiv preprint arXiv:2601.09853},
  year   = {2026}
}