SVII-3D:稀疏街景图像中的厘米级3D定位与理解提升道路设施清单
计算机视觉与模式识别
2026-01-16 v1
摘要
自动创建数字孪生体和精确资产清单是智能城市建设和设施生命周期管理中的关键任务。然而,利用成本效益高的稀疏图像仍具有局限性,包括鲁棒性差、定位不准以及缺乏细粒度理解。为此,提出SVII-3D,一个用于整体资产数字化的统一框架。首先,融合LoRA微调的开放集检测与空间注意力匹配网络,以稳健地关联稀疏视图中的观察。其次,引入几何引导的细化机制以解决结构性错误,实现厘米级的3D定位。最后,超越静态几何映射,纳入利用多模态提示的视觉语言模型智能体,以自动诊断细粒度的运行状态。实验表明,SVII-3D显著提高了识别准确率,最小化了定位误差。因此,该框架为高保真的设施数字化提供了可扩展且成本效益高的解决方案,有效弥合了稀疏感知与自动智能维护之间的鸿沟。
引用
@article{arxiv.2601.10535,
title = {SVII-3D: Advancing Roadside Infrastructure Inventory with Decimeter-level 3D Localization and Comprehension from Sparse Street Imagery},
author = {Chong Liu and Luxuan Fu and Yang Jia and Zhen Dong and Bisheng Yang},
journal= {arXiv preprint arXiv:2601.10535},
year = {2026}
}