基于深度强化学习的协作视觉对话智能体学习
计算机视觉与模式识别
2017-03-22 v2 人工智能
计算与语言
机器学习
摘要
我们引入了首个用于视觉问答与对话智能体的目标驱动训练。具体而言,我们提出了一个在两个智能体——Qbot和Abot——之间的协作“图像猜测”游戏,它们通过自然语言对话交流,以使Qbot能从一组图像中选出一张未见过的图像。我们利用深度强化学习(RL)端到端地学习这些智能体的策略——从像素到多智能体多轮对话再到游戏奖励。我们展示了两个实验结果。首先,作为纯RL(从零开始)的“健全性检查”演示,我们在一个合成世界上展示了结果,其中智能体使用未接地词汇(即无预定义含义的符号(X、Y、Z))交流。我们发现两个bot发明了它们自己的通信协议,并开始使用某些符号来询问/回答某些视觉属性(形状/颜色/样式)。因此,我们展示了在无人类监督下“视觉”对话智能体中接地语言与通信的出现。其次,我们在VisDial数据集上进行了大规模真实图像实验,使用有监督对话数据预训练,并表明RL“微调”智能体显著优于SL智能体。有趣的是,RL Qbot学会提出Abot擅长的问题,最终产生信息更丰富的对话和更好的团队。
引用
@article{arxiv.1703.06585,
title = {Learning Cooperative Visual Dialog Agents with Deep Reinforcement Learning},
author = {Abhishek Das and Satwik Kottur and José M. F. Moura and Stefan Lee and Dhruv Batra},
journal= {arXiv preprint arXiv:1703.06585},
year = {2017}
}
备注
11 pages, 4 figures, 2 tables, webpage: http://visualdialog.org/