中文

RL/LLM 分类树:回顾强化学习与大语言模型之间的协同作用

计算与语言 2024-08-29 v1 人工智能 机器学习 机器人学

摘要

在这项工作中,我们回顾了结合强化学习 (RL) 和大语言模型 (LLM) 的研究,这两个领域的发展都得益于深度神经网络的发展。我们基于两种模型类型的交互方式,提出了一种包含三个主要类别的新颖分类法。第一类 RL4LLM 包括利用 RL 提升 LLM 在与自然语言处理相关任务上的性能的研究。RL4LLM 根据是使用 RL 直接微调现有的 LLM 还是改进 LLM 的提示,分为两个子类。在第二类 LLM4RL 中,LLM 协助执行本质上与自然语言无关任务的 RL 模型的训练。我们根据 LLM 协助或替代的 RL 训练框架的组件(即奖励塑造、目标生成和策略函数),进一步细分 LLM4RL。最后,在第三类 RL+LLM 中,LLM 和 RL 智能体被嵌入到一个共同的规划框架中,且两者都不参与对方的训练或微调。我们进一步将此类分支,以区分有无自然语言反馈的研究。我们使用该分类法来探索 LLM 和 RL 协同作用背后的动机,并解释其成功的原因,同时指出潜在的不足和需要进一步研究的领域,以及实现相同目标的替代方法。

关键词

引用

@article{arxiv.2402.01874,
  title  = {The RL/LLM Taxonomy Tree: Reviewing Synergies Between Reinforcement Learning and Large Language Models},
  author = {Moschoula Pternea and Prerna Singh and Abir Chakraborty and Yagna Oruganti and Mirco Milletari and Sayli Bapat and Kebei Jiang},
  journal= {arXiv preprint arXiv:2402.01874},
  year   = {2024}
}

备注

30 pages (including bibliography), 1 figure, 7 tables