中文

MonoLayout:从单幅图像进行非模态场景布局估计

计算机视觉与模式识别 2020-02-21 v1 机器学习 机器人学

摘要

在本文中,我们解决了估计复杂城市驾驶场景布局这一新颖且极具挑战性的问题。给定从驾驶平台捕获的单幅彩色图像,我们的目标是预测道路和其他交通参与者的鸟瞰图布局。估计的布局应推理超出图像中可见的内容,并补偿由于投影导致的三维信息损失。我们将此问题称为非模态场景布局估计(amodal scene layout estimation),其涉及对图像中被遮挡的世界部分甚至进行“幻觉式”场景布局。为此,我们提出 MonoLayout,一种用于从单幅图像实时非模态场景布局估计的深度神经网络。我们将场景布局表示为多通道语义占据栅格,并利用对抗式特征学习对遮挡图像部分幻觉出合理的补全。由于缺乏公平的基线方法,我们将若干最先进的鸟瞰图道路布局估计和车辆占据估计方法扩展到非模态设置以进行严格评估。通过利用时序传感器融合生成训练标签,我们在多个数据集上显著优于当前最佳方法。在 KITTI 和 Argoverse 数据集上,我们以显著优势优于所有基线。我们还公开了所有标注和代码。本文的视频摘要可在 https://www.youtube.com/watch?v=HcroGyo6yRQ 获取。

关键词

引用

@article{arxiv.2002.08394,
  title  = {MonoLayout: Amodal scene layout from a single image},
  author = {Kaustubh Mani and Swapnil Daga and Shubhika Garg and N. Sai Shankar and Krishna Murthy Jatavallabhula and K. Madhava Krishna},
  journal= {arXiv preprint arXiv:2002.08394},
  year   = {2020}
}

备注

To be presented at WACV 2020 Video: https://www.youtube.com/watch?v=HcroGyo6yRQ Project page: https://hbutsuak95.github.io/monolayout