用于周围环境感知的跨视角语义分割
计算机视觉与模式识别
2020-07-28 v3 图像与视频处理
摘要
周围环境感知在人类空间感知中起着至关重要的作用,因为它从观测中提取物体的空间配置以及自由空间。为使机器人具备此种周围环境感知能力,我们引入了一项称为跨视角语义分割的新视觉任务,并提出一个名为视角解析网络(View Parsing Network, VPN)的框架来解决该问题。在跨视角语义分割任务中,智能体被训练将第一视角观测解析为俯视视角语义地图,以像素级指示所有物体的空间位置。该任务的主要问题在于我们缺乏俯视视角数据的真实世界标注。为缓解此问题,我们在 3D 图形环境中训练 VPN,并利用域适应技术将其迁移以处理真实世界数据。我们在合成与真实世界智能体上评估了我们的 VPN。实验结果表明,我们的模型能有效利用来自不同视角和多模态的信息来理解空间信息。我们在 LoCoBot 机器人上的进一步实验表明,我们的模型可从 2D 图像输入实现周围环境感知能力。代码与演示视频见 \url{https://view-parsing-network.github.io}。
引用
@article{arxiv.1906.03560,
title = {Cross-view Semantic Segmentation for Sensing Surroundings},
author = {Bowen Pan and Jiankai Sun and Ho Yin Tiga Leung and Alex Andonian and Bolei Zhou},
journal= {arXiv preprint arXiv:1906.03560},
year = {2020}
}