中文

认识你的邻居:通过空间视觉语言推理提升单视图重建

计算机视觉与模式识别 2025-04-01 v2 人工智能

摘要

从单视图恢复3D场景几何是计算机视觉中的一个基本而难以准确的问题。虽然经典的深度估计方法仅推断受限于图像平面的2.5D场景表示,但基于辐射场的最近方法重建了完整的3D表示。然而,这些方法仍在遮挡区域困难,因为在没有视觉观察的情况下推断几何需要(i)场景的语义知识,以及(ii)关于空间上下文的推理。我们提出KYN,一种用于单视图场景重建的方法,通过推理语义和空间上下文来预测每个点的密度。我们引入视觉语言调制模块,通过细粒度语义信息丰富点特征。我们通过语言引导的空间注意力机制聚合点表示,以获得意识到3D语义上下文的每个点的密度预测。我们展示,KYN在3D形状恢复方面优于孤立预测每个3D点的密度。我们在KITTI-360上实现了在场景和对象重建方面的最佳结果,并显示出比先前工作更好的零样本泛化。项目页面:https://ruili3.github.io/kyn。

关键词

引用

@article{arxiv.2404.03657,
  title  = {OW-VISCapTor: Abstractors for Open-World Video Instance Segmentation and Captioning},
  author = {Anwesa Choudhuri and Girish Chowdhary and Alexander G. Schwing},
  journal= {arXiv preprint arXiv:2404.03657},
  year   = {2025}
}

备注

Project page: https://anwesachoudhuri.github.io/OpenWorldVISCap/