TransLocNet:基于跨模态注意力的航空-地面车辆定位与对比学习
计算机视觉与模式识别
2025-12-12 v1
摘要
航空-地面定位由于地面级 LiDAR 与俯瞰图像之间的大尺度视角和模态差异,存在较大困难。我们提出 TransLocNet,一种跨模态注意力框架,用于将 LiDAR 几何信息与航空语义上下文融合。将 LiDAR 激光扫描投影到鸟瞰视图表示,并通过双向注意力与航空特征对齐,随后通过概率图解码器输出位置和姿态的空间概率分布。对比学习模块强制共享嵌入空间以提高跨模态对齐效果。在 CARLA 和 KITTI 上的实验表明,TransLocNet 优于最先进的基线方法,将定位误差降低最高可达 63%,实现亚米级、亚角度的精度。这些结果表明 TransLocNet 在合成和真实场景中均能提供稳健且可泛化的航空-地面定位能力。
引用
@article{arxiv.2512.10419,
title = {TransLocNet: Cross-Modal Attention for Aerial-Ground Vehicle Localization with Contrastive Learning},
author = {Phu Pham and Damon Conover and Aniket Bera},
journal= {arXiv preprint arXiv:2512.10419},
year = {2025}
}
备注
8 pages, 4 figures, 4 tables