利用图像内表观相似性实现高效的全图像交互式分割
计算机视觉与模式识别
2020-07-17 v1
摘要
我们提出了一种用于交互式全图像语义分割的新方法,该方法能够快速为具有先前未见语义类别的新数据集收集训练数据(演示见 https://youtu.be/yUk8D5gEX-o)。我们利用一个关键观察:从已标注像素到未标注像素的传播不一定需要类别特定的知识,而可以纯粹基于图像内的表观相似性完成。基于这一观察,我们提出了一种能够联合传播多类别像素标签而无需显式类别特定表观模型的方法。为实现长距离传播,我们的方法首先全局度量整幅图像中已标注与未标注像素间的表观相似性。随后局部整合逐像素度量,从而提升边界精度并消除均匀区域中的噪声标签跳变。我们还设计了一个高效的人工标注界面,在传统多边形绘制工具基础上扩展了一套便捷的附加功能(并加入自动传播)。在 COCO Panoptic Challenge 数据集上由人类标注者进行的实验表明,我们更优的手动界面与新颖的自动传播机制相结合,使标注时间相比多边形绘制减少 2 倍以上。我们还在 ADE-20k 和 Fashionista 数据集上测试了我们的方法,未做任何数据集特定适配或重新训练模型,证明其可泛化至新数据集与视觉类别。
引用
@article{arxiv.2007.08173,
title = {Efficient Full Image Interactive Segmentation by Leveraging Within-image Appearance Similarity},
author = {Mykhaylo Andriluka and Stefano Pellegrini and Stefan Popov and Vittorio Ferrari},
journal= {arXiv preprint arXiv:2007.08173},
year = {2020}
}