MoL-RL:将多步骤环境反馈蒸馏到 LLM 以实现无反馈推理
计算与语言
2025-07-29 v1
摘要
大型语言模型(LLMs)面临在有效利用序列环境反馈(EF)信号(如自然语言评估)进行无反馈链式思维(CoT)推理方面的重大挑战。现有方法要么将 EF 转换为标量奖励,丢失丰富的上下文信息,要么采用精炼数据集,未能发挥 EF 交互的多步骤和离散性。为此,我们提出了 MoL-RL,一种新颖的训练范式,通过双目标优化框架将多步骤 EF 信号整合到 LLM 中。该方法结合 MoL(损失混合)持续训练,将领域特定 EF 信号(通过交叉熵损失优化)与通用语言能力(通过 KL 散度保持)解耦,并基于 GRPO 的后训练将序列 EF 交互蒸馏为单步推理。这种协同作用实现了无需依赖外部反馈循环即可实现稳健的反馈独立推理。在数学推理(MATH-500、AIME24/AIME25)和代码生成(CodeAgent-Test)基准测试中,实验结果表明 MoL-RL 在 Qwen3-8B 模型上实现了最先进的性能,同时在不同模型规模(Qwen3-4B)上保持强大的泛化能力。该工作为利用多步骤文本反馈增强 LLM 在各类领域的推理能力提供了一条有前景的道路。
引用
@article{arxiv.2507.20278,
title = {MoL-RL: Distilling Multi-Step Environmental Feedback into LLMs for Feedback-Independent Reasoning},
author = {Kang Yang and Jingxue Chen and Qingkun Tang and Tianxiang Zhang and Qianchun Lu},
journal= {arXiv preprint arXiv:2507.20278},
year = {2025}
}
备注
12pages,3figures