虚假奖励悖论:机制性理解 RLVR 如何激活 LLM 中的记忆捷径
机器学习
2026-01-19 v1 计算与语言
摘要
带有可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)在增强 LLM 推理方面非常有效,但最近的证据表明,像 Qwen 2.5 这样的模型即使使用虚假或错误的奖励也能获得显著的收益。我们研究了这一现象并识别出一个“困惑度悖论”:虚假的 RLVR 触发了一种分化,即答案 token 困惑度下降,而提示侧连贯性退化,这表明模型正在绕过推理而倾向于记忆。使用路径修补、Logit Lens、JSD 分析和神经微分方程,我们发现了一个隐藏的锚定-适配器电路,它促进了这一捷径。我们在中间层(L18-20)定位了一个功能性锚点,它触发了对记忆解决方案的检索,随后在较后层(L21+)的结构适配器将表示转换为适应捷径信号。最后,我们证明了缩放该电路内的特定 MLP 键允许双向因果引导——人为放大或抑制由数据污染驱动的性能。我们的结果为识别和缓解 RLVR 微调模型中的数据污染提供了机制性路线图。代码可在 https://github.com/idwts/How-RLVR-Activates-Memorization-Shortcuts 获取。
引用
@article{arxiv.2601.11061,
title = {Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs},
author = {Lecheng Yan and Ruizhe Li and Guanhua Chen and Qing Li and Jiahui Geng and Wenxi Li and Vincent Wang and Chris Lee},
journal= {arXiv preprint arXiv:2601.11061},
year = {2026}
}
备注
Work in process