中文

探究深度神经网络中 3D 泛化的本质

计算机视觉与模式识别 2023-04-20 v1 人工智能 机器学习

摘要

视觉物体识别系统需要从一组 2D 训练视角泛化到新颖视角。人类视觉系统如何泛化到新颖视角的问题已在心理学、计算机视觉与神经科学中被研究与建模。用于物体识别的现代深度学习架构能很好地泛化到新颖视角,但其机制尚不清晰。在本文中,我们刻画了常见深度学习架构泛化到新颖视角的能力。我们将此表述为一个有监督分类任务,其中标签对应于唯一的 3D 物体,样本对应于物体在不同 3D 朝向上的 2D 视图。我们考虑了三种常见的新颖视角泛化模型:(i) 完全 3D 泛化,(ii) 纯 2D 匹配,以及 (iii) 基于视角线性组合的匹配。我们发现深度模型能很好地泛化到新颖视角,但其方式不同于所有这些现有模型。对超出训练集所涵盖视角范围的视图的外推有限,而对新颖旋转轴的外推更为有限,这意味着网络并未推断完整的 3D 结构,也未使用线性插值。然而,其泛化远优于纯 2D 匹配。这些发现有助于设计所需 2D 视图以实现 3D 泛化的数据集。复现我们实验的代码公开可用:https://github.com/shoaibahmed/investigating_3d_generalization.git

关键词

引用

@article{arxiv.2304.09358,
  title  = {Investigating the Nature of 3D Generalization in Deep Neural Networks},
  author = {Shoaib Ahmed Siddiqui and David Krueger and Thomas Breuel},
  journal= {arXiv preprint arXiv:2304.09358},
  year   = {2023}
}

备注

15 pages, 15 figures, CVPR format