从样本难度角度解读 RLVR 中 LLM 的作用机制
人工智能
2026-05-28 v1
摘要
强化学习可验证奖励 (RLVR) 已被证明显著提升大型语言模型 (LLM) 在数学和编程领域的推理性能。然而,样本难度在 RLVR 中的机制性作用尚不清晰。本文通过难度分层分析和单样本分析探讨 RLVR。我们发现样本难度对 RLVR 具有非单调效应:容易和中等难度问题提供最强且最稳定的推理改进,而过于困难的问题常提供弱学习信号,诱导答案重复或跳过必要计算,从而最终损害模型既有能力。除响应外,我们进一步使用时序稀疏自编码器 (T-SAE) 分析模型内部特征动态。容易问题主要强化直接作答和基础计算特征,抑制 deliberative-reasoning 特征;困难问题激活推理相关特征,但仅在成功轨迹被采样时才有用;中等难度问题提供更平衡的信号,强化计算和多步骤推理特征。基于这些发现,我们提出基于反向推理重构和 T-SAE 指导训练信号的难样本适应策略,以提高 RLVR 中的奖励密度和信用分配。总体而言,我们的结果识别了样本难度作为支配 RLVR 优化动力学和表示演化的关键因素。
引用
@article{arxiv.2605.28388,
title = {Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs},
author = {Yue Cheng and Jiajun Zhang and Xiaohui Gao and Weiwei Xing and Zheng Wang and Zhanxing Zhu},
journal= {arXiv preprint arXiv:2605.28388},
year = {2026}
}
备注
30 pages, 11 figures