知道何时放弃:医学 LLM 在临床不确定性下的应对
计算与语言
2026-01-23 v2 人工智能
摘要
当前对大型语言模型(LLM)的评估过度关注准确性;然而,在真实世界和安全关键型应用中,能够在不确定时选择放弃的能力同样至关重要,可信赖的部署离不开这一点。我们引入 MedAbstain,一个用于医学多选问答(MCQA)中放弃机制的统一基准和评估协议——这一离散选择设置可推广到代理行动选择中,集成了保守预测、对抗性问题扰动和明确的放弃选项。我们系统评估了开放式和封闭式 LLM,发现即使是最先进的、高准确性模型也常常在不确定时未能放弃。值得注意的是,提供明确的放弃选项会显著增加模型的不确定性和更安全的放弃行为,远超输入扰动的效果,而扩大模型规模或使用高级提示技术带来的改进有限。这些发现凸显了放弃机制在可信 LLM 部署中的核心作用,并为提高高风险应用的安全性提供了实用指导。
引用
@article{arxiv.2601.12471,
title = {Knowing When to Abstain: Medical LLMs Under Clinical Uncertainty},
author = {Sravanthi Machcha and Sushrita Yerra and Sahil Gupta and Aishwarya Sahoo and Sharmin Sultana and Hong Yu and Zonghai Yao},
journal= {arXiv preprint arXiv:2601.12471},
year = {2026}
}
备注
Equal contribution for the first two authors; To appear in proceedings of the Main Conference of the European Chapter of the Association for Computational Linguistics (EACL) 2026