中文

VisualHints:一种用于多模态强化学习的视觉-语言环境

机器学习 2020-10-28 v1 计算与语言

摘要

我们提出 VisualHints,一种用于多模态强化学习(RL)的新颖环境,涉及基于文本的交互以及(从环境中获得的)视觉提示。现实生活中的问题常常要求智能体同时使用自然语言信息和视觉感知与环境交互以达成目标。然而,大多数传统 RL 环境要么解决纯基于视觉的任务(如 Atari 游戏或基于视频的机器人操控),要么完全使用自然语言作为交互方式(如基于文本的游戏和对话系统)。在这项工作中,我们旨在弥合这一差距,并将这两种方法统一于一个用于多模态 RL 的单一环境中。我们引入了 TextWorld 烹饪环境的扩展,在其中穿插添加了视觉线索。目标是迫使 RL 智能体同时使用文本和视觉特征来预测自然语言动作指令,以完成烹饪一餐的最终任务。我们使环境中的变化和难度能够模拟各种交互式真实世界场景。我们提出了一个基线多模态智能体,使用基于 CNN 的特征提取处理视觉提示,并使用 LSTM 提取文本特征来解决此类问题。我们相信我们提出的视觉-语言环境将为 RL 社区促成新颖的问题设定。

关键词

引用

@article{arxiv.2010.13839,
  title  = {VisualHints: A Visual-Lingual Environment for Multimodal Reinforcement Learning},
  author = {Thomas Carta and Subhajit Chaudhury and Kartik Talamadupula and Michiaki Tatsubori},
  journal= {arXiv preprint arXiv:2010.13839},
  year   = {2020}
}

备注

Code is available at http://ibm.biz/VisualHints