中文

基于精细三维物体表示的场景理解探索

计算机视觉与模式识别 2014-11-24 v1

摘要

当前语义图像与场景理解方法通常采用较为简单的物体表示,如二维或三维边界框。尽管此类粗略模型鲁棒性强且能实现可靠的物体检测,但它们丢弃了大量关于物体三维形状与姿态的信息,因而难以胜任更高层次的推理。本文提出基于高分辨率物体表示进行场景理解。以汽车为例,将物体类别建模为可变形三维线框,从而在单个顶点与面的层级实现细粒度建模。我们增强该模型以显式包含顶点级遮挡,并将所有实例嵌入统一坐标系,以便推断和利用物体间交互。具体而言,从单一视图出发,我们在统一三维坐标系中联合估计多个物体的形状与姿态。该坐标系中的地平面通过不同物体间的共识进行估计,显著稳定了单目三维姿态估计。细粒度模型结合显式三维场景模型,进一步允许推断建模物体间的部件级遮挡,以及其他未建模场景元素造成的遮挡。为展示此类精细物体类别模型在场景理解中的优势,我们在具有挑战性的KITTI街景数据集上系统评估了所提方法。实验表明,模型在单个部件层级利用图像证据的能力,改善了单目三维姿态估计在位置与(连续)视角方面的表现。

关键词

引用

@article{arxiv.1411.5935,
  title  = {Towards Scene Understanding with Detailed 3D Object Representations},
  author = {M. Zeeshan Zia and Michael Stark and Konrad Schindler},
  journal= {arXiv preprint arXiv:1411.5935},
  year   = {2014}
}

备注

International Journal of Computer Vision (appeared online on 4 November 2014). Online version: http://link.springer.com/article/10.1007/s11263-014-0780-y