为何蒸馏能优于 Zero-RL:灵活推理的作用
人工智能
2025-05-28 v1
摘要
强化学习(RL)在提升大型语言模型(LLM)的推理能力方面发挥了重要作用。一些研究将 RL 直接应用于较小的基座模型(称为 zero-RL),也取得了显著进展。然而,在本文中,我们表明仅使用 920 个示例,一种基于基座模型的简单蒸馏方法就能明显优于通常需要更多数据和计算成本的 zero-RL。通过分析模型输出中的 token 频率,我们发现蒸馏模型表现出更灵活的推理。它使用拟人化 token 和逻辑连接词的频率远高于 zero-RL 模型。进一步分析表明,蒸馏增强了两种高级认知行为的存在:多视角思考或尝试以及元认知意识。这两种高级认知行为的频繁出现促成了灵活推理,这对于解决复杂推理问题至关重要,而 zero-RL 未能显著提升这些行为的频率。
引用
@article{arxiv.2505.21067,
title = {Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning},
author = {Xiao Hu and Xingyu Lu and Liyuan Mao and YiFan Zhang and Tianke Zhang and Bin Wen and Fan Yang and Tingting Gao and Guorui Zhou},
journal= {arXiv preprint arXiv:2505.21067},
year = {2025}
}