无思考策略初始化使提炼推理模型更有效率
机器学习
2025-12-25 v2 计算与语言
摘要
可验证奖励的强化学习(RLVR)有效解决复杂任务,但训练期间需要极长的上下文长度,导致计算成本高昂。虽然多阶段训练可部分缓解此问题,但过于短的初始上下文常导致不可逆的性能退化,最终未能显著降低总体训练计算。本文引入**T**hinking-**F**ree **P**olicy **I**nitialization(**TFPI**),一种简单而有效的RLVR适应方法,桥接长链式思维(CoT)蒸馏与标准RLVR。TFPI采用简单的*ThinkFree*操作,通过直接*删除*思考内容来减少推理时的token使用。使用*ThinkFree*-适应输入进行训练可提升性能并降低token消耗,即便在原始慢速思考模式下亦如此。广泛实验表明,TFPI加速RL收敛,达成更高的性能天花板,生成更高效的推理模型,无需特殊奖励或复杂训练设计。仅凭TFPI,我们即可在不足4K H20小时内训练一个4B模型,在AIME24上达到89.0%的准确率,在LiveCodeBench上达到65.5%的准确率。
引用
@article{arxiv.2509.26226,
title = {Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners},
author = {Xin Xu and Cliveb AI and Kai Yang and Tianhao Chen and Yang Wang and Saiyong Yang and Can Yang},
journal= {arXiv preprint arXiv:2509.26226},
year = {2025}
}