中文

用于自监督语义分割的混合调配微调

计算机视觉与模式识别 2018-01-31 v3 机器学习

摘要

用于语义图像分割的深度卷积网络通常需要大规模标注数据(如 ImageNet 和 MS COCO)进行网络预训练。为减少标注工作量,近期提出了自监督语义分割,以在无任何人工提供标签的情况下预训练网络。这种新学习形式的关键在于设计代理任务(如图像着色),从而可在无标签数据上构造判别性损失。然而,许多代理任务缺乏可诱导出面向目标图像分割任务的判别性表示的临界监督信号。因此自监督的性能仍远不及有监督预训练。在本研究中,我们通过在自监督流程中引入“混合调配”(M&M)微调阶段克服了该局限。所提方法可便捷插入多种自监督方法,且未比原始过程使用更多标注样本。但它能够将目标图像分割任务的性能提升至超越全监督预训练对应方法。该改进得益于更好地利用了目标数据集中有限的逐像素标注。具体而言,我们首先引入“混合”阶段,其从目标集稀疏采样并混合图像块,以反映目标图像丰富多样的局部块统计。“调配”阶段随后形成类级连通图,可用于导出强基于三元组的判别性损失以微调网络。我们的范式遵循现有自监督研究的标准做法,且不需要额外数据或标签。借助所提 M&M 方法,自监督方法首次能在 PASCAL VOC2012 数据集与 CityScapes 数据集上取得与其 ImageNet 预训练对应方法相当甚至更优的性能。

关键词

引用

@article{arxiv.1712.00661,
  title  = {Mix-and-Match Tuning for Self-Supervised Semantic Segmentation},
  author = {Xiaohang Zhan and Ziwei Liu and Ping Luo and Xiaoou Tang and Chen Change Loy},
  journal= {arXiv preprint arXiv:1712.00661},
  year   = {2018}
}

备注

To appear in AAAI 2018 as a spotlight paper. More details at the project page: http://mmlab.ie.cuhk.edu.hk/projects/M%26M/