中文

通过姿态估计与匹配实现通用 3D 表示

计算机视觉与模式识别 2017-10-24 v1 机器学习 神经与进化计算 机器人学

摘要

尽管大量计算机视觉研究致力于开发通用语义表示,但在开发类似的 3D 表示方面所做的努力有限。在本文中,我们通过解决一组基础代理 3D 任务来学习通用 3D 表示:以物体为中心的相机姿态估计和宽基线特征匹配。我们的方法基于这样一个前提:通过对一组精心选择的基础任务提供监督,可以实现对新任务的泛化和抽象能力。我们通过实证表明,为解决上述核心问题而训练的多任务 ConvNet 的内部表示可以泛化到新的 3D 任务(例如场景布局估计、物体姿态估计、表面法线估计),而无需微调,并表现出抽象能力的特征(例如跨模态姿态估计)。在核心监督任务的背景下,我们证明我们的表示实现了最先进的宽基线特征匹配结果,且无需先验校正(不同于 SIFT 和大多数学习到的特征)。我们还展示了给定一对局部图像块的 6DOF 相机姿态估计。这两个监督任务的精度都与人类相当。最后,我们贡献了一个由以物体为中心的街景场景组成的大规模数据集,包含点对应关系和相机姿态信息,并以对所学表示和开放研究问题的讨论作为结尾。

关键词

引用

@article{arxiv.1710.08247,
  title  = {Generic 3D Representation via Pose Estimation and Matching},
  author = {Amir R. Zamir and Tilman Wekel and Pulkit Argrawal and Colin Weil and Jitendra Malik and Silvio Savarese},
  journal= {arXiv preprint arXiv:1710.08247},
  year   = {2017}
}

备注

Published in ECCV16. See the project website http://3drepresentation.stanford.edu/ and dataset website https://github.com/amir32002/3D_Street_View