中文

局部连贯还是全局有效?探究 RLVR 在数学领域中的推理轨迹

人工智能 2025-10-22 v1 机器学习

摘要

基于可验证奖励(RLVR)的大型语言模型(LLM)后训练方法已被证明可提高推理任务上的准确率,持续吸引大量关注。然而,现有的 RLVR 方法通常对所有 token 均匀处理,而未考虑 token 级别的优势。这些方法主要依据最终答案的正确性或 Pass@K准确率来评估性能,却对 RL 后训练导致推理轨迹改进的论断持有看法。这促使我们调查 RL 后训练对中间 token(即未获得直接激励的 token)的影响。为研究此问题,我们设计了在 GSM8K 数据集上使用 GRPO 算法对 Qwen-2.5-0.5B 模型进行实验的设置。我们引入 trace coherence(推理轨迹连贯性),一种基于一阶逻辑(FOL)的度量,用于通过识别轨迹中的错误来捕捉推理步骤的一致性。我们区分了轨迹有效性(trace validity)和轨迹连贯性(trace coherence),指出前者意味着逻辑上的正确性,而后者通过缺乏错误来衡量局部连贯性。我们的结果表明,RL 后训练总体上提高了推理轨迹的连贯性,在基模型失败但 RL 模型成功的题目上获得了最显著的提升。令人惊讶的是,RL 虽然未必产生有效或正确的解决方案,却提升了局部连贯性。这突显了一种关键区别:推理步骤的局部连贯性改进并不必然保证最终答案的正确性。我们认为,对 RL 推理能力改进的论断必须谨慎审视,因为这些可能基于改进的推理轨迹连贯性,而这可能并不转化为完整的有效数学证明。

关键词

引用

@article{arxiv.2510.18176,
  title  = {Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains},
  author = {Soumya Rani Samineni and Durgesh Kalwar and Vardaan Gangal and Siddhant Bhambri and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2510.18176},
  year   = {2025}
}

备注

4 pages, 2 figures