中文

认识邻居:通过空间视觉语言推理提升单视图重建

计算机视觉与模式识别 2024-04-05 v1

摘要

从单视图恢复3D场景几何是计算机视觉中的一个基本但难以确定的问题。虽然经典的深度估计方法仅推断受限于图像平面的2.5D场景表示,但基于辐射场的最近方法能重建完整的3D表示。然而,这些方法仍在缺失遮挡区域困难,因为在没有视觉观察的情况下推断几何需要(i)对周围环境的语义知识,以及(ii)关于空间上下文的推理。我们提出KYN方法,用于单视图场景重建,通过推理语义和空间上下文来预测每个点的密度。我们引入视觉语言调制模块,用以丰富点的特征以获得细粒度的语义信息。我们通过语言引导的空间注意力机制聚合场景中点的表征,以获得意识到3D语义上下文的逐点密度预测。我们表明,KYN在预测每个3D点的密度时优于孤立预测,能够提升3D形状恢复效果。在KITTI-360上实现最新结果,显示出比现有方法更好的零样本泛化能力。项目页面:https://ruili3.github.io/kyn。

关键词

引用

@article{arxiv.2404.03658,
  title  = {Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language Reasoning},
  author = {Rui Li and Tobias Fischer and Mattia Segu and Marc Pollefeys and Luc Van Gool and Federico Tombari},
  journal= {arXiv preprint arXiv:2404.03658},
  year   = {2024}
}

备注

CVPR 2024. Project page: https://ruili3.github.io/kyn