语言模型与强化学习的组合化指令跟随
机器学习
2025-01-23 v1 计算与语言
摘要
将强化学习与语言 grounding 结合具有挑战性,因为代理需要在同时学习多个语言条件任务的同时探索环境。为此,我们提出一种新方法:组合化强化学习语言智能体(Compositioanlly-enabled Reinforcement Learning Language Agent, CERLLA)。该方法通过利用组合化策略表示和使用强化学习和 in-context learning 训练的语义解析器来降低以语言指定任务的样本复杂度。我们在需要函数逼近的环境中评估了该方法,展示了对新任务的组合化泛化。该方法在 162 个测试组合化泛化的任务上,相较于前所未有的非组合化基线在样本复杂度方面显著优越。我们的模型取得了更高的成功率,并在更少的步骤中学习;达到与 oracle policy 上限性能相等的 92% 成功率。而与之比较,基线方法在相同环境步骤数下仅达到 80% 的成功率。
引用
@article{arxiv.2501.12539,
title = {Compositional Instruction Following with Language Models and Reinforcement Learning},
author = {Vanya Cohen and Geraud Nangue Tasse and Nakul Gopalan and Steven James and Matthew Gombolay and Ray Mooney and Benjamin Rosman},
journal= {arXiv preprint arXiv:2501.12539},
year = {2025}
}
备注
TMLR 2024