中文

NeMo:用于鲁棒三维姿态估计的对比特征神经网格模型

计算机视觉与模式识别 2021-02-05 v3

摘要

三维姿态估计是计算机视觉中一项具挑战性但重要的任务。本工作中,我们表明标准的深度学习三维姿态估计方法在物体被部分遮挡或从先前未见的姿态观察时并不鲁棒。受生成式视觉模型对部分遮挡鲁棒性的启发,我们提出将深度神经网络与物体三维生成式表示整合进一个统一的神经架构,称之为NeMo。具体而言,NeMo在稠密三维网格的每个顶点上学习神经特征激活的生成模型。利用可微渲染,我们通过最小化NeMo与目标图像特征表示之间的重建误差来估计三维物体姿态。为避免重建损失中的局部最优,我们训练特征提取器以使用对比学习最大化网格上各特征表示之间的距离。我们在PASCAL3D+、occluded-PASCAL3D+和ObjectNet3D上的大量实验表明,与标准深度网络相比,NeMo对部分遮挡和未见姿态的鲁棒性显著更强,同时在常规数据上保持有竞争力的性能。有趣的是,我们的实验还表明,即便网格表示仅以长方体粗略近似真实物体几何,NeMo也表现相当良好,从而揭示精确的三维几何对于准确的三维姿态估计并非必需。代码公开于 https://github.com/Angtian/NeMo。

关键词

引用

@article{arxiv.2101.12378,
  title  = {NeMo: Neural Mesh Models of Contrastive Features for Robust 3D Pose Estimation},
  author = {Angtian Wang and Adam Kortylewski and Alan Yuille},
  journal= {arXiv preprint arXiv:2101.12378},
  year   = {2021}
}

备注

Accepted by ICLR 2021. Code is publicly available