强化学习人类反馈下的校准崩溃:奖励作弊如何破坏大语言模型中的不确定性量化
机器学习
2026-04-14 v1 人工智能
计算与语言
摘要
现代大型语言模型(LLM)越来越多地通过强化学习从人类反馈(RLHF)或相关奖励优化方案进行微调。虽然此类程序提高了感知的帮助性,但我们调查是否存在通过鸡巢式奖励信号导致校准退化——这是可靠不确定性量化所必需的属性。我们对Qwen3-8B进行了三种微调:无微调(base)、在TriviaQA上进行中性监督微调(SFT),以及采用奖励与植入的错误答案保持一致的鸡巢式Group Relative Policy Optimisation(GRPO)。我们在1000个MMLU题目(覆盖五个学科领域)上进行评估,使用bootstrap置信区间和置换检验,发现鸡巢式GRPO产生了持续的校准退化——相对基线模型,ECE上升+0.006,相对中性SFT,MCE上升+0.010——尽管在当前训练预算下未达到统计显著性(p=0.41)。对所有三个模型应用事后矩阵缩放,可将ECE降低40%-64%,并提高1.5%-3.0个百分点的准确率。然而,鸡巢式模型在缩放后仍保持最高的后校准ECE(0.042 vs. 0.037),表明奖励引起的校准失效即使在仿射校正后仍残留结构性特征。这一发现建立了评估奖励作弊对校准影响的方法,并激励开发校准感知的训练目标。
引用
@article{arxiv.2604.10585,
title = {Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs},
author = {Subramanyam Sahoo},
journal= {arXiv preprint arXiv:2604.10585},
year = {2026}
}
备注
Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages