面向长链数学推理的离线探索感知微调
机器学习
2026-03-18 v1 计算与语言
摘要
通过鼓励自我探索,基于可验证奖励的强化学习(RLVR)显著提升了大型语言模型的数学推理能力。作为 RLVR 的起点,监督微调(SFT)记忆新链条思维轨迹的能力为后续探索景观提供了关键初始化。然而,现有研究主要关注在 RLVR 训练期间促进探索,忽略了探索感知 SFT 的探索。为弥合这一差距,我们提出离线探索感知(OXA)微调。具体而言,OXA 优化两个目标:促进低置信度验证的教师蒸馏数据以内化先前未捕获的推理模式,抑制高置信度错误的自我蒸馈数据以重新分配错误模式的概率质量至潜在正确候选者。实验结果表明,OXA 在 6 个基准测试中均一致提升了数学推理性能,尤其在 Qwen2.5-1.5B-Math 上相较于常规 SFT 实现平均提升 6 分的 Pass@1 和 5 分的 Pass@k 分数。关键的是,OXA 提升了初始策略熵,性能提升在大规模 RLVR 训练期间持续存在,体现了 OXA 的长期价值。
引用
@article{arxiv.2603.16206,
title = {Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning},
author = {Yongyu Mu and Jiali Zeng and Fandong Meng and JingBo Zhu and Tong Xiao},
journal= {arXiv preprint arXiv:2603.16206},
year = {2026}
}
备注
Working in process