中文

从语言到目标:基于视觉指令跟随的逆强化学习

机器学习 2019-02-22 v1 机器学习

摘要

强化学习是解决控制问题的一个有前景的框架,但其在实际情境中的使用受到奖励函数往往难以设计的阻碍。为自主机器(如机器人)指定目标和任务是一项重大挑战:传统上,奖励函数和goal状态被用来传达目标。但人们彼此之间仅通过描述或演示即可传达目标。我们如何构建学习算法,使我们能够告诉机器我们想要它们做什么?在这项工作中,我们研究利用逆强化学习将语言指令 grounding 为奖励函数的问题,并论证语言条件奖励比语言条件策略更易迁移到新环境。我们提出语言条件奖励学习(LC-RL),其将语言指令 grounding 为由深度神经网络表示的奖励函数。我们证明,在具有自然语言指令的逼真、高维视觉环境中,我们的模型学到的奖励可迁移到新任务和新环境,而直接学习语言条件策略则导致较差的性能。

关键词

引用

@article{arxiv.1902.07742,
  title  = {From Language to Goals: Inverse Reinforcement Learning for Vision-Based Instruction Following},
  author = {Justin Fu and Anoop Korattikara and Sergey Levine and Sergio Guadarrama},
  journal= {arXiv preprint arXiv:1902.07742},
  year   = {2019}
}