中文

Explicit3D:基于空间推理的图网络用于单图像三维目标检测

计算机视觉与模式识别 2023-11-21 v3 机器人学

摘要

室内三维目标检测是单图像场景理解中的一项基本任务,从根本上影响着视觉推理中的空间认知。现有从单幅图像进行三维目标检测的工作要么通过对每个目标独立预测来追求该目标,要么对所有可能目标进行隐式推理,未能利用目标之间的几何关系信息。为解决此问题,我们提出了一种基于目标几何与语义特征的动态稀疏图流程,名为 Explicit3D。考虑到效率,我们进一步定义了关联度评分,并设计了一种新颖的动态剪枝算法及后续的簇采样方法,用于稀疏场景图的生成与更新。此外,我们的 Explicit3D 引入齐次矩阵,并定义了新的相对损失与角点损失,以显式建模目标对之间的空间差异。与直接使用真实标签作为监督不同,我们的相对损失与角点损失由齐次变换导出,使模型学习目标间的几何一致性。在 SUN RGB-D 数据集上的实验结果表明,我们的 Explicit3D 相比当前最优方法取得了更好的性能平衡。

关键词

引用

@article{arxiv.2302.06494,
  title  = {Explicit3D: Graph Network with Spatial Inference for Single Image 3D Object Detection},
  author = {Yanjun Liu and Wenming Yang},
  journal= {arXiv preprint arXiv:2302.06494},
  year   = {2023}
}