中文

视觉好奇心:通过学习提问来习得视觉识别

机器人学 2018-10-03 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在开放世界环境中,智能体(如机器人)不可避免地会遇到其无法识别的视觉对象、属性或关系。本工作中,我们开发了一种具备视觉好奇心(visual curiosity)的智体,即能够向 Oracle(如人类)询问图像内容(如:红色立方体左侧的物体是什么?)并基于收到的回答(如:圆柱体)构建视觉识别模型的能力。为此,该智体必须(1)理解其识别与未识别的内容,(2)提出有效、无歧义且信息丰富的语言查询(问题)询问 Oracle,(3)从 Oracle 响应中导出视觉分类器参数,以及(4)利用更新后的视觉分类器提出更明晰的问题。具体而言,我们提出一种新颖框架,并将视觉好奇心的学习表述为强化学习问题。在该框架中,我们智体的所有组件——视觉识别模块(看)、问题生成策略(问)、答案消化模块(理解)与图记忆模块(记忆)——均完全端到端学习,以最大化由智体通过与 Oracle 对话所得到的场景图带来的奖励。重要的是,问题生成策略与视觉识别系统及环境细节解耦。因此,我们展示了一种双重泛化:我们的问题生成策略泛化到新环境及一双新眼睛(即新视觉系统)。在合成数据集上训练的结果表明,即便在含新颖物体的合成环境及真实环境中测试,我们的智体习得新视觉概念的速度也显著快于若干启发式基线。

关键词

引用

@article{arxiv.1810.00912,
  title  = {Visual Curiosity: Learning to Ask Questions to Learn Visual Recognition},
  author = {Jianwei Yang and Jiasen Lu and Stefan Lee and Dhruv Batra and Devi Parikh},
  journal= {arXiv preprint arXiv:1810.00912},
  year   = {2018}
}

备注

18 pages, 10 figures, Oral Presentation in Conference on Robot Learning (CoRL) 2018