从互联网学习逐像素标注而无需人工交互
计算机视觉与模式识别
2018-05-22 v1
摘要
深度学习在许多计算机视觉任务中处于前沿。然而,深度神经网络通常渴求数据,需要海量精标注训练样本。在许多应用中收集充足标注数据极为昂贵,尤其是对于语义分割等像素级预测任务。为解决这一根本问题,我们考虑一项新的具挑战性的视觉任务——互联网监督语义分割,其仅使用带有对应查询关键词噪声图像级监督的互联网数据来训练分割模型。我们通过提出如下方案应对该任务。提出一种统一多尺度前向与反向卷积特征的类特定注意力模型,以提供初始分割“真值”。利用此类噪声标注训练得到的模型随后通过在线微调过程得以改进。该方法在PASCAL VOC2012数据集弱监督设定下取得了最先进性能。所提框架也为从互联网无需人工交互地学习开辟了新途径,并可作为其中的强基线。代码与数据将在论文录用后发布。
引用
@article{arxiv.1805.07548,
title = {Learning Pixel-wise Labeling from the Internet without Human Interaction},
author = {Yun Liu and Yujun Shi and JiaWang Bian and Le Zhang and Ming-Ming Cheng and Jiashi Feng},
journal= {arXiv preprint arXiv:1805.07548},
year = {2018}
}