Recall-Extend 动力学:通过受控探索与精炼离线集成提升小型语言模型
机器学习
2025-08-26 v1 人工智能
计算与语言
摘要
许多现有研究通过可验证奖励的强化学习 (RLVR) 在大型语言模型 (LLMs) 上取得了显著的推理能力提升,而在小型语言模型 (SLMs) 的推理能力提升方面尚未得到充分探索。将来自更大模型的蒸馏数据与 RLVR 在小模型上联合训练是一种自然的做法,但仍面临诸多挑战和问题。因此,本文提出了一种称为 \textit{\underline{R}}ecall-\textit{\underline{E}}xtend \textit{\underline{D}}ynamics (RED) 的方法,通过受控探索和精炼离线集成来提升小型语言模型。在本文中,我们探讨了变化的探索空间、平衡离线蒸馏与在线强化学习的视角。同时,我们特别设计并优化了离线数据中的插入问题。通过监控模型关于离线数据和在线数据之间熵变化的比例,我们调节离线-SFT 的权重,从而解决小模型探索空间不足以及蒸馏过程中冗余和复杂性问题。此外,为了应对离线数据与当前策略之间的分布差异,我们设计了一种基于样本准确性的策略迁移机制,动态选择模仿离线蒸馏数据或从自身策略中学习。
引用
@article{arxiv.2508.16677,
title = {Recall-Extend Dynamics: Enhancing Small Language Models through Controlled Exploration and Refined Offline Integration},
author = {Zhong Guan and Likang Wu and Hongke Zhao and Jiahui Wang and Le Wu},
journal= {arXiv preprint arXiv:2508.16677},
year = {2025}
}