奖励审计:在真实世界扰动情景下的奖励建模适格性推断
计算与语言
2026-05-18 v5
摘要
可靠的奖励模型(RM)对于确保大型语言模型(LLM)的安全对齐至关重要。然而,当前的RM评估方法仅关注特定情景下偏好感知准确性,掩盖了RM在真实世界情景中所固有的关键漏洞。我们认识到,评估RM适格性(Suitability)——即在特定真实世界扰动下的条件可靠性——是面临的真正挑战。为此,我们引入奖励审计(Reward Auditor),一个专为RM适格性推断设计的假设检验框架。它不回答"RM对给定样本的偏好感知有多准确?",而是通过科学审计回答:"我们能否推断RM在特定真实世界情景中是否存在系统性漏洞?"在真实世界扰动情景下,奖励审计通过审计RM偏好感知置信度分布退化,量化统计显著性和效应大小,从而推断RM在多样化真实世界情景中漏洞的确定性与严重程度。这为构建可验证安全、更稳健且值得信赖的下一代LLM对齐系统奠定了坚实基础。
引用
@article{arxiv.2512.00920,
title = {Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios},
author = {Jianxiang Zang and Yongda Wei and Ruxue Bai and Shiyu Jiang and Nijia Mo and Binhong Li and Qiang Sun and Hui Liu},
journal= {arXiv preprint arXiv:2512.00920},
year = {2026}
}