忠实性与安全性:评估反事实医学证据下的大语言模型行为
计算与语言
2026-04-21 v2
摘要
在医学等高风险领域,模型忠实地遵循所提供的上下文通常是可取的。但如果上下文与模型的先验知识或安全协议不一致,会发生什么?在本文中,我们研究了大语言模型(LLM)在面对反事实(甚至是对抗性)医学证据时的行为和推理方式。我们首先构建了MedCounterFact,这是一个反事实医学问答数据集,要求模型回答临床比较问题(即,判断某些治疗方法的疗效,并以随机对照试验作为上下文提供的证据)。在MedCounterFact中,问题和证据中的真实世界医疗干预措施被系统地替换为四种类型的反事实刺激,范围从未知词语到有毒物质。我们在多个前沿LLM上对MedCounterFact的评估表明,在存在反事实证据的情况下,现有模型绝大多数会不加批判地接受这些“证据”,即使它们是危险或难以置信的,并给出自信且不加保留的答案。虽然在忠实性与安全性之间划定界限可能是审慎的做法,但我们的发现表明,模型可能过度强调了前者。
引用
@article{arxiv.2601.11886,
title = {Faithfulness vs. Safety: Evaluating LLM Behavior Under Counterfactual Medical Evidence},
author = {Kaijie Mo and Siddhartha Venkatayogi and Chantal Shaib and Ramez Kouzy and Wei Xu and Byron C. Wallace and Junyi Jessy Li},
journal= {arXiv preprint arXiv:2601.11886},
year = {2026}
}
备注
Accepted to Findings of ACL 2026