此疗法有效,对吗?评估 LLM 在医学问答中对患者问题措辞敏感性
计算与语言
2026-04-08 v1 人工智能
摘要
患者日益倾向于使用大语言模型 (LLM) 来询问复杂且难以清晰表述的医学问题。然而,LLM 对提示措辞敏感,可能受问题表述方式的影响。理想情况下,LLM 应对措辞变化作出一致响应,尤其是当其基于相同的底层证据时。我们通过在受控的检索增强生成 (RAG) 环境中进行医学问答评估来检验这一点,采用专家挑选的文档而非自动检索。我们检验两个维度的患者查询变体:问题措辞(积极 vs. 消极)和语言风格(技术性 vs. 日常语言)。我们构建了一个包含 6,614 对查询对的数据集,基于临床试验摘要进行评估,并在八个 LLM 上评估响应一致性。我们的发现表明,积极和消极措辞的配对查询对产生的结论显然更可能相互矛盾,而相同措辞的配对查询则更一致。这种措辞效应在多轮对话中进一步放大,其中持续的说服作用增加了不一致性。我们发现措辞与语言风格之间不存在显著的相互作用。我们的结果表明,即使在基于相同证据的情境下,LLM 在医学问答中的响应可以通过查询措辞方式受到系统性影响,凸显在高风险场景中以措辞鲁棒性作为评估标准对 RAG 系统的重要性。
引用
@article{arxiv.2604.05051,
title = {This Treatment Works, Right? Evaluating LLM Sensitivity to Patient Question Framing in Medical QA},
author = {Hye Sun Yun and Geetika Kapoor and Michael Mackert and Ramez Kouzy and Wei Xu and Junyi Jessy Li and Byron C. Wallace},
journal= {arXiv preprint arXiv:2604.05051},
year = {2026}
}
备注
31 pages, 4 tables, 19 figures