用于从单张RGB图像定位未遮挡物体实例的深度多腔解码
计算机视觉与模式识别
2020-07-16 v3 机器学习
图像与视频处理
摘要
遮挡感知的实例敏感分割是一项复杂任务,通常通过基于区域的分割、将实例近似为其边界框来处理。我们研究密集同质布局这一典型场景,其中该近似不成立。在此场景下,由于卷积层的平移不变性以及解码器复杂度的缺乏,通过解码深度编码器来勾画未遮挡实例变得困难。因此我们提出一种多腔设计,由特定子任务的轻量解码器和编码器-解码器单元组成,以级联方式耦合,以鼓励特定子任务的特征复用并在解码过程中强制一条学习路径。此外,最先进的遮挡感知实例分割数据集包含具有少量实例的真实图像,且遮挡主要源于物体遮挡背景,不同于密集物体布局。因此我们还引入了一个密集同质物体布局的合成数据集,即Mikado,其每张图像包含的实例数和实例间遮挡数均远超这些公开数据集。我们在Mikado和公开数据集上的大量实验表明,解码过程中的有序多尺度单元比最先进的设计模式更能有效捕获位置敏感表征。我们还表明Mikado相对于真实世界问题是合理的,因为它能够学习可迁移至真实图像的、提升性能的表征,同时大幅减少微调所需的人工标注。所提出的数据集将公开可用。
引用
@article{arxiv.1906.07480,
title = {Deep Multicameral Decoding for Localizing Unoccluded Object Instances from a Single RGB Image},
author = {Matthieu Grard and Emmanuel Dellandréa and Liming Chen},
journal= {arXiv preprint arXiv:1906.07480},
year = {2020}
}
备注
International Journal of Computer Vision, Springer Verlag, 2020, Special Issue on Deep Learning for Robotic Vision