中文

利用群级自然语言反馈引导强化学习中的探索

计算与语言 2026-03-06 v1 人工智能

摘要

大型语言模型 (LLM) 通常通过与环境交互方式接收多样化的自然语言 (NL) 反馈。然而,当前强化学习 (RL) 算法仅依赖标量奖励,未能充分利用 NL 反馈中所蕴含的丰富信息,导致探索效率低下。本文提出 GOLF 框架,显式地利用群级语言反馈引导有针对性的探索。GOLF 汇聚两种互补的反馈来源:(i) 外部批评,指出错误或提出针对性修正;(ii) 群内尝试,提供替代性部分想法及多样化的失败模式。这些群级反馈被汇聚以生成高质量的改进方案,并在训练过程中以非策略方式注入,以在稀疏奖励区域提供有针对性的指导。同时,GOLF 在统一的 RL 循环内联合优化生成与改进,形成良性循环,不断提升两者的能力。在可验证与不可验证基准测试上进行实验表明,GOLF 在性能与探索效率上均显著优于仅依赖标量奖励的 RL 方法,样本效率提升约 2.2 倍。代码已公开于 https://github.com/LuckyyySTA/GOLF。

关键词

引用

@article{arxiv.2603.04597,
  title  = {Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning},
  author = {Lei Huang and Xiang Cheng and Chenxiao Zhao and Guobin Shen and Junjie Yang and Xiaocheng Feng and Yuxuan Gu and Xing Yu and Bing Qin},
  journal= {arXiv preprint arXiv:2603.04597},
  year   = {2026}
}