中文

通过自编码三维变换实现自监督多视图学习

计算机视觉与模式识别 2021-03-02 v1 机器学习

摘要

三维物体表示学习是计算机视觉中推断三维世界的一项基本挑战。深度学习的近期进展已展现出其在三维物体识别中的高效性,其中基于视图的方法迄今表现最佳。然而,现有方法的多视图特征学习多以监督方式进行,往往需大量高成本的数据标签。相反,自监督学习旨在不涉及标注数据的情况下学习多视图特征表示。为此,我们提出一种新颖的自监督范式来学习多视图变换等变表示(MV-TER),探索三维物体及其投影多视图的等变变换。具体而言,我们对三维物体施加三维变换,并通过投影获得变换前后的多视图。然后,我们通过从变换前后多视图的融合特征表示中解码三维变换参数,来自训练一种捕获内在三维物体表示的表示。实验结果表明,所提 MV-TER 在三维物体分类与检索任务中显著优于最先进的基于视图的方法,并展示出对真实世界数据集的泛化能力。

关键词

引用

@article{arxiv.2103.00787,
  title  = {Self-Supervised Multi-View Learning via Auto-Encoding 3D Transformations},
  author = {Xiang Gao and Wei Hu and Guo-Jun Qi},
  journal= {arXiv preprint arXiv:2103.00787},
  year   = {2021}
}