中文

基于跨模态与跨视图对应关系的自监督特征学习

计算机视觉与模式识别 2020-04-14 v1

摘要

监督学习的成功需要大规模真值标签,其标注极为昂贵、耗时,或可能需要特殊技能。为解决此问题,许多自监督或无监督方法被提出。与大多数现有仅学习 2D 图像特征或仅学习 3D 点云特征的自监督方法不同,本文提出一种新颖有效的自监督学习方法,通过利用跨模态与跨视图对应关系,在无需任何人工标注标签的情况下联合学习 2D 图像特征与 3D 点云特征。具体而言,由不同视图渲染图像的 2D 图像特征通过 2D 卷积神经网络提取,3D 点云特征通过图卷积神经网络提取。两类特征送入两层全连接神经网络以估计跨模态对应关系。三个网络通过验证两个不同模态的采样数据是否属于同一物体来联合训练(即跨模态),同时,2D 卷积神经网络还通过最小化不同视图渲染图像的类内距离并最大化类间距离来额外优化(即跨视图)。所学 2D 与 3D 特征的有效性通过将它们迁移至五项不同任务来评估,包括多视图 2D 形状识别、3D 形状识别、多视图 2D 形状检索、3D 形状检索与 3D 部件分割。在所有五个不同任务上跨数据集的广泛评估证明了所提自监督方法学到的 2D 和 3D 特征具有强泛化性与有效性。

关键词

引用

@article{arxiv.2004.05749,
  title  = {Self-supervised Feature Learning by Cross-modality and Cross-view Correspondences},
  author = {Longlong Jing and Yucheng Chen and Ling Zhang and Mingyi He and Yingli Tian},
  journal= {arXiv preprint arXiv:2004.05749},
  year   = {2020}
}