中文

真知源于实践:通过强化学习将LLM与具身环境对齐

机器学习 2024-03-12 v2 人工智能 计算与语言

摘要

尽管在众多任务上表现出色,大语言模型(LLMs)在解决简单决策任务时常常失败,原因在于LLM中的知识与环境之间存在错位。相反,强化学习(RL)智能体从零开始学习策略,这使其始终与环境对齐,但难以融入先验知识以实现高效探索。为缩小这一差距,我们提出了TWOSOME,这是一个新颖的通用在线框架,它将LLM部署为决策智能体,通过RL与具身环境高效交互并对齐,无需任何准备好的数据集或环境的先验知识。首先,我们利用LLM查询每个有效动作的联合概率以形成行为策略。然后,为了增强策略的稳定性和鲁棒性,我们提出了两种归一化方法并总结了四条提示设计原则。最后,我们设计了一种新颖的参数高效训练架构,其中行动者和评论家共享一个配备低秩适配器(LoRA)并通过PPO更新的冻结LLM。我们进行了大量实验来评估TWOSOME。i) 在经典的决策环境Overcooked和模拟家庭环境VirtualHome中,TWOSOME相较于传统的RL方法PPO和提示调优方法SayCan,展现出显著更好的样本效率和性能。ii) 受益于LLM的开放词汇特性,TWOSOME对未见任务表现出优越的泛化能力。iii) 在我们的框架下,在线PPO微调过程中,LLM的原始能力没有显著损失。

关键词

引用

@article{arxiv.2401.14151,
  title  = {True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning},
  author = {Weihao Tan and Wentao Zhang and Shanqi Liu and Longtao Zheng and Xinrun Wang and Bo An},
  journal= {arXiv preprint arXiv:2401.14151},
  year   = {2024}
}

备注

Accepted by ICLR2024