监控性作为一种免费礼物:RLVR 中推理对齐的自发现象
人工智能
2026-02-05 v1 机器学习
摘要
随着大型推理模型(LRMs)的日益增多的部署,审计其链式思维(CoT)轨迹以确保安全变得至关重要。最近的研究报告称,监控性——即链式思维是否忠实且信息丰富地反映内部计算的程度——在强化学习可验证奖励(RLVR)的早期阶段时,常常表现为一种“免费礼物”。我们通过在多个模型家族和训练领域中的系统评估,将这一观察具体化。我们的结果表明,这一效应并非普遍:监控性的改进高度依赖数据。特别是,我们展示了数据多样性和指令遵循数据在 RLVR 训练中的关键作用。我们进一步表明,监控性与能力是正交的——推理性能的提升并不意味着透明度的增加。通过机制分析,我们将监控性增益归因于响应分布的锐化(熵的减少)和对提示的注意力增加,而非更强的对推理轨迹的因果依赖。我们还揭示了监控性动态如何随受控训练和评估难度的变化而变化。总体而言,这些发现提供了对 RLVR 下监控性如何出现的全面视图,阐明了何时可能出现收益以及何时不会出现收益。
引用
@article{arxiv.2602.03978,
title = {Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning},
author = {Zidi Xiong and Shan Chen and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2602.03978},
year = {2026}
}