中文

面向强化学习中大语言模型的选择性专家指导:实现有效且多样的探索

人工智能 2025-10-07 v1 计算与语言

摘要

基于可验证奖励的强化学习(RLVR)已成为增强大型语言模型(LLM)推理能力的常用技术。然而,RLVR的效果强烈依赖于底层模型的能力。这一问题源于模型需具备足够能力执行高质量探索,而探索既涉及有效性,也涉及多样性。不幸的是,现有方法通过仿照专家轨迹来解决此问题,虽提升有效性,却忽视了多样性。为此,我们认为专家只需在关键决策点提供指导,而非整个推理路径。基于此洞察,我们提出MENTOR:一种用于推理令牌级优化的混合策略专家导航框架,通过仅在关键决策点提供专家指导,实现RLVR中的有效且多样的探索。大量实验表明,MENTOR使模型捕捉专家策略的精髓而非表面模仿,从而实现高质量探索并取得卓越的总体性能。我们的代码已在线发布。

关键词

引用

@article{arxiv.2510.04140,
  title  = {Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs},
  author = {Zishang Jiang and Jinyi Han and Tingyun Li and Xinyi Wang and Sihang Jiang and Jiaqing Liang and Zhaoqian Dai and Shuguang Ma and Fei Yu and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2510.04140},
  year   = {2025}
}