中文

语言模型与强化学习的组合化指令跟随

机器学习 2025-01-23 v1 计算与语言

摘要

将强化学习与语言 grounding 结合具有挑战性,因为代理需要在同时学习多个语言条件任务的同时探索环境。为此,我们提出一种新方法:组合化强化学习语言智能体(Compositioanlly-enabled Reinforcement Learning Language Agent, CERLLA)。该方法通过利用组合化策略表示和使用强化学习和 in-context learning 训练的语义解析器来降低以语言指定任务的样本复杂度。我们在需要函数逼近的环境中评估了该方法,展示了对新任务的组合化泛化。该方法在 162 个测试组合化泛化的任务上,相较于前所未有的非组合化基线在样本复杂度方面显著优越。我们的模型取得了更高的成功率,并在更少的步骤中学习;达到与 oracle policy 上限性能相等的 92% 成功率。而与之比较,基线方法在相同环境步骤数下仅达到 80% 的成功率。

关键词

引用

@article{arxiv.2501.12539,
  title  = {Compositional Instruction Following with Language Models and Reinforcement Learning},
  author = {Vanya Cohen and Geraud Nangue Tasse and Nakul Gopalan and Steven James and Matthew Gombolay and Ray Mooney and Benjamin Rosman},
  journal= {arXiv preprint arXiv:2501.12539},
  year   = {2025}
}

备注

TMLR 2024