中文

基于几何约束嵌入与半监督训练的单目三维检测

计算机视觉与模式识别 2020-09-03 v1

摘要

在本工作中,我们提出一种新颖的、基于单阶段与关键点的单目三维物体检测框架,仅使用RGB图像,称为KM3D-Net。我们设计了一个全卷积模型来预测物体关键点、尺寸与朝向,并将这些估计量与透视几何约束相结合以计算位置属性。进一步,我们将几何约束重新表述为可微分版本并嵌入网络中,以在保持模型输出端到端一致性的同时减少运行时间。得益于这一简洁结构,我们随后提出了一种在标注训练数据稀缺情形下的有效半监督训练策略。该策略中,我们对同一无标注图像在不同输入增强条件与网络正则化下强制两个共享权重的KM3D-Net达成共识预测。特别地,我们将坐标相关的增强统一为物体差分恢复位置的仿射变换,并提出了一个关键点丢弃模块用于网络正则化。我们的模型仅需RGB图像,无需合成数据、实例分割、CAD模型或深度生成器。尽管如此,在流行的KITTI三维检测数据集上的大量实验表明,KM3D-Net在效率与精度上均以大幅优势超越所有先前的最先进方法。并且,据我们所知,这是半监督学习首次应用于单目三维物体检测。在KITTI上仅使用13%标注数据时,我们甚至超越了多数先前的全监督方法。

关键词

引用

@article{arxiv.2009.00764,
  title  = {Monocular 3D Detection with Geometric Constraints Embedding and Semi-supervised Training},
  author = {Peixuan Li},
  journal= {arXiv preprint arXiv:2009.00764},
  year   = {2020}
}

备注

16 pages