中文

基于 RGB 的自监督深度预训练语义分割

计算机视觉与模式识别 2020-02-07 v1

摘要

尽管诸如 ImageNet 等知名大规模数据集推动了图像理解的发展,但大多数此类数据集需要大量人工标注,因而难以扩展。这限制了图像理解技术的进展。这些大规模数据集的影响几乎体现在每一项视觉任务与技术中,形式多为用于初始化的预训练。在本工作中,我们提出一种易于扩展且自监督的技术,可用于预训练任意语义 RGB 分割方法。具体而言,我们的预训练方法利用可通过深度传感器自动生成的标签。这些称为 HN-labels 的标签表示不同的高度与法向块,从而能够挖掘在语义 RGB 分割任务中有用的局部语义信息。我们展示了如何使用所提出的带 HN-labels 的自监督预训练来替代 ImageNet 预训练,同时仅使用少 25 倍的图像且无需任何人工标注。我们用 HN-labels 预训练一个语义分割网络,这比在关联较小的任务(如 ImageNet 分类)上预训练更接近我们的最终任务。我们在两个数据集(NYUv2 与 CamVid)上评估,并展示了任务间的相似性不仅有利于加速预训练过程,而且比 ImageNet 预训练取得了更好的最终语义分割精度。

关键词

引用

@article{arxiv.2002.02200,
  title  = {RGB-based Semantic Segmentation Using Self-Supervised Depth Pre-Training},
  author = {Jean Lahoud and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2002.02200},
  year   = {2020}
}