中文

TransLocNet:基于跨模态注意力的航空-地面车辆定位与对比学习

计算机视觉与模式识别 2025-12-12 v1

摘要

航空-地面定位由于地面级 LiDAR 与俯瞰图像之间的大尺度视角和模态差异,存在较大困难。我们提出 TransLocNet,一种跨模态注意力框架,用于将 LiDAR 几何信息与航空语义上下文融合。将 LiDAR 激光扫描投影到鸟瞰视图表示,并通过双向注意力与航空特征对齐,随后通过概率图解码器输出位置和姿态的空间概率分布。对比学习模块强制共享嵌入空间以提高跨模态对齐效果。在 CARLA 和 KITTI 上的实验表明,TransLocNet 优于最先进的基线方法,将定位误差降低最高可达 63%,实现亚米级、亚角度的精度。这些结果表明 TransLocNet 在合成和真实场景中均能提供稳健且可泛化的航空-地面定位能力。

关键词

引用

@article{arxiv.2512.10419,
  title  = {TransLocNet: Cross-Modal Attention for Aerial-Ground Vehicle Localization with Contrastive Learning},
  author = {Phu Pham and Damon Conover and Aniket Bera},
  journal= {arXiv preprint arXiv:2512.10419},
  year   = {2025}
}

备注

8 pages, 4 figures, 4 tables