中文

奖励模型中的偏好不稳定性:稀疏自编码器的检测与缓解

机器学习 2026-05-19 v1

摘要

大型语言模型中的偏好学习依赖奖励模型作为人类判断的代理。然而,这些模型经常表现出偏好不稳定性,即便在轻微的、语义保存的输入变更下,也会产生矛盾的偏好赋值。我们在三种语义保存扰动类型下(改写、模式注入和后门触发器)分析了这种不稳定性在表示层面的情况。我们将这种不稳定性归因于对预测性但脆弱特征的过度依赖,称这些特征为不稳定特征,并通过稀疏自编码器(SAE)在稀疏潜空间中对其进行隔离,在该空间中,良性输入和扰动输入激活的模式具有明显的可分离性。基于这种可分离性,我们提出了两种基于 SAE 的不稳定性缓解策略:SAE 特征引导(SAE Feature Steering),用于识别和抑制推理时的异常激活特征;以及 SAE 残差校正(SAE Residual Correction),用于学习对 SAE 特征的自适应调整以恢复正确的偏好。我们的 метод显著降低了在无害性和幻觉基准测试中的错误偏好分配,同时在保持良好性能和其他任务的一般实用性方面表现良好,且无需重新训练奖励模型。我们的代码和数据可在 \url{https://github.com/shunchang-liu/pisa} 获取。

关键词

引用

@article{arxiv.2605.16339,
  title  = {Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders},
  author = {Shunchang Liu and Xin Chen and Belen Martin Urcelay and Francesco Croce},
  journal= {arXiv preprint arXiv:2605.16339},
  year   = {2026}
}