具身视觉识别
计算机视觉与模式识别
2019-04-10 v1 人工智能
机器学习
机器人学
摘要
被动视觉系统通常在物体被严重遮挡的非模态设置下无法识别物体。相比之下,人类与其他具身智能体能够在环境中移动,并主动控制视角以更好地理解物体形状与语义。本工作中,我们引入具身视觉识别(EVR)任务:一个智能体被实例化于靠近遮挡目标物体的 3D 环境中,并可自由移动以执行物体分类、非模态物体定位与非模态物体分割。为此,我们开发了名为 Embodied Mask R-CNN 的新模型,使智能体学习策略性移动以提升其视觉识别能力。我们使用 House3D 环境进行实验。实验结果表明:1)具有具身性(可移动)的智能体比被动智能体取得更好的视觉识别性能;2)为提升视觉识别能力,智能体可学习不同于最短路径的策略性移动路径。
引用
@article{arxiv.1904.04404,
title = {Embodied Visual Recognition},
author = {Jianwei Yang and Zhile Ren and Mingze Xu and Xinlei Chen and David Crandall and Devi Parikh and Dhruv Batra},
journal= {arXiv preprint arXiv:1904.04404},
year = {2019}
}
备注
14 pages, 13 figures, technical report