奖励镜头:奖励模型的机制解释库
机器学习
2026-04-30 v1 人工智能
摘要
每个受 RLHF 训练的语言模型都由奖励模型塑造,但机制解释工具箱——logit 镜头、直接 logit 归因、激活修补、稀疏自编码器——是为生成式 LLM 构建的,其原语都投射到词汇隐藏层上。奖励模型将其替换为标量回归头,破坏了每个工具。我们提出 reward-lens,一个开源库,将该工具箱移植到奖励模型上,围绕一个观察:奖励头的权重向量 是每个解释问题的自然轴。该库提供奖励镜头、组件归因、三模式激活修补、奖励-hacking 探针套件、TopK SAE 特征归因、跨模型比较以及五个理论支撑的扩展(失真指数、发散感知修补、误差级联检测、奖励-术语冲突分析、概念向量分析)。一个十方法适配器协议覆盖 Llama、Mistral、Gemma-2 和 ArmoRM 多目标头,以及针对任何 HuggingFace 序列分类模型的通用适配器。我们在两个生产奖励模型上进行了约695对 RewardBench 的验证。中心实证发现是负面的:线性归因不预测因果修补效应(Skywork 上平均 Spearman ,ArmoRM 上为 )。该框架将这种不一致视为一种要暴露的属性,而非 bug——这激励了一种保持观察和因果观点皆为一等并直接可比的设计。
引用
@article{arxiv.2604.26130,
title = {reward-lens: A Mechanistic Interpretability Library for Reward Models},
author = {Mohammed Suhail B Nadaf},
journal= {arXiv preprint arXiv:2604.26130},
year = {2026}
}
备注
30 pages, 5 figures, 9 tables, including appendix. Library available at https://github.com/suhailnadaf509/reward-lens (pip install reward-lens)