中文

融合 pervasive RF 数据与空间图像:基于 Vision Transformer 的智慧城市映射

计算机视觉与模式识别 2025-08-07 v1 人工智能

摘要

环境映射是智慧城市应用(包括自动导航、无线网络运营和扩展现实环境)的重要计算任务。传统的智慧城市映射技术(如卫星影像、LiDAR扫描和人工标注)常受制于成本、可访问性和准确性等局限。开源映射平台在人工智能应用中被广泛用于环境映射,作为参考数据的来源。然而,人为错误和真实环境的不断演变会引入偏差,可能负面影响训练此类数据的神经网络性能。本文提出了一种基于深度学习的方法,将DINOv2架构与来自多个无线用户设备和基站收集的射频(RF)数据相结合,以提高建筑物映射精度。我们的做法利用基于视觉转换器的架构在统一框架中联合处理RF和地图两种模态,有效捕获空间依赖性和结构先验,以实现更高的映射精度。为进行评估,我们采用了由华为共同生产的合成数据集。我们开发并训练了一个仅利用聚合路径损耗信息来解决映射问题的模型。我们根据三个捕捉不同质量指标的性能指标进行衡量:(i) Jaccard指数,也称为交并比(IoU),(ii) Hausdorff距离,和(iii) Chamfer距离。我们的设计实现了65.3%的宏观IoU,显著优于(1)产生错误地图的基线方法(40.1%),(2)文献中基于RF的方法(37.3%),和(3)我们设计的非AI融合基线方法(42.2%)。

关键词

引用

@article{arxiv.2508.03736,
  title  = {Fusion of Pervasive RF Data with Spatial Images via Vision Transformers for Enhanced Mapping in Smart Cities},
  author = {Rafayel Mkrtchyan and Armen Manukyan and Hrant Khachatrian and Theofanis P. Raptis},
  journal= {arXiv preprint arXiv:2508.03736},
  year   = {2025}
}

备注

Work partly supported by the RA Science Committee grant No. 22rl-052 (DISTAL) and the EU under Italian National Recovery and Resilience Plan of NextGenerationEU on "Telecommunications of the Future" (PE00000001 - program "RESTART")