中文

通过双向反馈机制实现大语言模型与强化学习模型的相互增强:一项规划案例研究

计算与语言 2025-03-04 v2

摘要

大语言模型(LLMs)已展现出对强化学习(RL)模型而言卓越的能力,例如规划和推理能力。然而,LLMs 与 RL 模型协作的问题仍需解决。在本研究中,我们采用一个师生学习框架来解决这些问题,具体而言,是在一个协作多智能体环境中,利用 RL 模型为 LLMs 提供反馈,并利用 LLMs 为 RL 模型提供高层信息。在此框架内,LLM 充当教师,而 RL 模型充当学生。这两个智能体通过一个递归帮助过程(例如“我帮助你帮我帮你”)相互协作。LLM 智能体向 RL 智能体提供抽象信息,从而实现高效的探索和策略改进。反过来,RL 智能体向 LLM 智能体提供反馈,提供有价值的实时信息,帮助生成更有用的词元。这种双向反馈循环促进了两个智能体的优化、探索和相互改进,使它们能够完成日益复杂的任务。值得注意的是,我们提出了一个实用算法来解决该问题,并进行了实证实验以评估我们方法的有效性。

关键词

引用

@article{arxiv.2401.06603,
  title  = {Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Planning Case Study},
  author = {Shangding Gu},
  journal= {arXiv preprint arXiv:2401.06603},
  year   = {2025}
}