能量景观使面向医疗保健的检索增强大语言模型具备可靠的弃权能力
计算与语言
2025-09-09 v2 人工智能
摘要
可靠的弃权对于检索增强生成(RAG)系统至关重要,特别是在女性健康等安全攸关领域,错误的答案可能导致伤害。我们提出了一种基于能量的模型(EBM),该模型在包含 260 万个源自指南的问题的密集语义语料库上学习平滑的能量景观,使系统能够决定何时生成或弃权。我们在简单和困难弃权划分上将 EBM 与校准的 softmax 基线和 k 近邻(kNN)密度启发式方法进行了基准比较,其中困难案例是语义上具有挑战性的近分布查询。EBM 在语义困难案例上取得了更优的弃权性能,AUROC 达到 0.961,而 softmax 为 0.950,同时降低了 FPR@95(0.235 对 0.331)。在简单负样本上,各方法的性能相当,但 EBM 的优势在安全攸关的困难分布上最为显著。通过控制负采样和公平数据暴露的全面消融实验表明,鲁棒性主要源于能量评分头,而特定负样本类型(困难、简单、混合)的包含或排除会锐化决策边界,但对于困难案例的泛化并非必需。这些结果表明,基于能量的弃权评分比基于概率的 softmax 置信度提供了更可靠的置信信号,为安全的 RAG 系统提供了可扩展且可解释的基础。
引用
@article{arxiv.2509.04482,
title = {Energy Landscapes Enable Reliable Abstention in Retrieval-Augmented Large Language Models for Healthcare},
author = {Ravi Shankar and Sheng Wong and Lin Li and Magdalena Bachmann and Alex Silverthorne and Beth Albert and Gabriel Davis Jones},
journal= {arXiv preprint arXiv:2509.04482},
year = {2025}
}