基于稀疏自编码器的 SteerRM:对奖励模型进行去偏
计算与语言
2026-03-16 v1
摘要
奖励模型(RM)是对齐管道中的关键组件,但它们倾向于对浅显的风格线索持偏见,更青睐表现更好的回应而非语义更优的回应。现有的去偏方法通常需要重新训练或修改网络结构,而直接抑制激活会因表示 entangled而损害性能。我们提出SteerRM,首个基于稀疏自编码器(SAE)的训练-free去偏方法。SteerRM利用对比配对回应来隔离风格效应,识别出具备强度-稳定性准则的偏差相关 SAE 特征,并在推理时抑制这些特征。在RM-Bench上的六个奖励模型实验表明,SteerRM平均将Hard-split准确率提高了7.3分,同时保持整体性能。Gemma-based奖励模型和受控非格式偏差的实验进一步表明该方法在不同奖励模型架构和偏差类型之间具有广泛的可推广性。我们进一步发现,格式相关特征集中在浅层且跨模型可迁移,这揭示了架构层面偏差编码模式的共享性。这些结果表明,SAE-based干预可在不重新训练的情况下缓解奖励模型偏差,为对齐管道提供一种实用且可解释的解决方案。
引用
@article{arxiv.2603.12795,
title = {SteerRM: Debiasing Reward Models via Sparse Autoencoders},
author = {Mengyuan Sun and Zhuohao Yu and Weizheng Gu and Shikun Zhang and Wei Ye},
journal= {arXiv preprint arXiv:2603.12795},
year = {2026}
}