通过组合式策略学习遵循语言指令
机器学习
2021-10-12 v1 计算与语言
摘要
我们提出一个框架,用于在由目标达成任务组成的环境中执行自然语言指令,这些任务在其任务描述上共享若干组件。我们的方法利用了价值函数与语言两者的组合性,旨在降低学习新任务的样本复杂度。首先,我们训练一个强化学习智能体学习价值函数,这些函数随后可通过布尔代数进行组合以解决新任务。其次,我们对在网页规模语料上预训练的 seq2seq 模型进行微调,以将语言映射为指定所需价值函数组合的逻辑表达式。在 BabyAI 领域中评估我们的智能体时,我们观察到在掌握单个任务后学习第二个任务所需的训练步数减少了 86%。消融研究的结果进一步表明,正是组合式价值函数与语言表示的结合使智能体能够快速泛化到新任务。
引用
@article{arxiv.2110.04647,
title = {Learning to Follow Language Instructions with Compositional Policies},
author = {Vanya Cohen and Geraud Nangue Tasse and Nakul Gopalan and Steven James and Matthew Gombolay and Benjamin Rosman},
journal= {arXiv preprint arXiv:2110.04647},
year = {2021}
}
备注
Presented at AI-HRI symposium as part of AAAI-FSS 2021 (arXiv:2109.10836)