大型语言模型中的风险约束样本后筛选(SAFER)
人工智能
2026-02-17 v3
摘要
随着大型语言模型(LLM)在诸如真实世界开放式问答(QA)等风险敏感应用中的不断部署,确保其输出可信度已成为关键。现有的选择性保守预测(SCP)方法通过构建受控 miscoverage rate 的预测集提供统计保证。然而,先前工作不切实际地假设对于所有实例都可通过有限抽样获得可接受答案,即使是缺乏固定有限解空间的开放式 QA 场景。为此,我们引入一个两阶段风险控制框架,包括 abstention-aware 抽样和保守筛选(SAFER)。首先,在持留的校准集上,SAFER 在最大抽样上限内校准抽样预算,依据用户期望的风险水平(即抽样集最大可接受 miscoverage rate)使用 Clopper-Pearson 精确方法。如果风险水平无法在上限内满足,则我们放弃;否则,校准好的抽样预算成为测试时的最小要求。随后,我们使用在校准预算下可获得正确答案的校准实例,并应用保守风险控制方法来确定统计上有效的不确定性阈值,从而筛选每个测试数据点的候选集中的不可靠干扰项。在此阶段,SAFER 引入额外的风险水平来指导阈值的计算,从而控制正确答案被排除的风险。此外,我们展示 SAFER 可与各种任务特定的入选标准和校准-测试划分比例相兼容,凸显其鲁健性和高数据效率。
引用
@article{arxiv.2510.10193,
title = {SAFER: Risk-Constrained Sample-then-Filter in Large Language Models},
author = {Qingni Wang and Yue Fan and Xin Eric Wang},
journal= {arXiv preprint arXiv:2510.10193},
year = {2026}
}