中文

MapAnything: 用于3D城市资产定位的单目度量深度模型评估

计算机视觉与模式识别 2026-05-20 v2

摘要

城市行政部门越来越依赖综合数据库和城市数字孪生体,对城市资产(如交通标志和树木)以及事件(如涂鸦或道路损坏)进行全面管理,以有效地了解城市状况。数字化进程推动了对持续更新空间数据集的需求,但当前的数据获取和维护过程仍需要相当大的手动工作量,带来了显著的可扩展性挑战。本文引入MapAnything,一种新的地理定位框架,自动从单一单目图像中实现城市对象的空间映射。通过利用先进的度量深度估计模型,MapAnything准确计算对象地理坐标,将2D图像数据转换为有价值的3D空间信息。该方法将估计的相机到对象距离与已知相机规范结合起来。我们对该框架进行详细的验证,将其距离估计精度与高精度LiDAR点云进行比较,在复杂的城市环境中进行细粒度的空间性能分析,涵盖各种距离区间和语义区域,如道路和植被区域。最后,我们通过具体的用例演示了该框架的实际有效性,包括映射交通标志和道路铺装损坏,并为其集成到自动化城市盘点系统中提供了建议。

关键词

引用

@article{arxiv.2509.14839,
  title  = {MapAnything: Evaluating Monocular Metric Depth Models for 3D Urban Asset Localization},
  author = {Miriam Louise Carnot and Jonas Kunze and Erik Quinten Fastermann and Eric Peukert and André Ludwig and Bogdan Franczyk},
  journal= {arXiv preprint arXiv:2509.14839},
  year   = {2026}
}