中文

SMGeo:基于网格级稀疏Mixture-of-Experts的跨视图目标地理定位

计算机视觉与模式识别 2025-11-19 v1

摘要

跨视图目标地理定位旨在基于无人机图像精确定位大规模卫星影像中的相同对象。由于视点和尺度的显著差异,以及复杂的背景干扰,传统的多阶段“检索-匹配”管道容易产生累积误差。为此,我们提出SMGeo,一个支持点击提示并可在交互式使用时实时输出对象地理定位的端到端基于Transformer的模型。该模型采用完全基于Transformer的架构,利用Swin-Transformer对无人机和卫星图像进行联合特征编码,并使用无锚框Transformer检测头进行坐标回归。为更好地捕获跨模态和视图内依赖性,我们引入网格级稀疏Mixture-of-Experts(GMoE)到跨视图编码器中,使其能够根据每个网格的内容、尺度和来源自适应激活专用专家。我们还采用无锚框检测头进行坐标回归,直接通过参考图像中的热图监督预测对象位置。该方法避免了预定义锚框引入的尺度偏差和匹配复杂性。在无人机到卫星任务中,SMGeo在IoU=0.25和mIoU指标上实现领先性能(例如,在测试集中分别为87.51%、62.50%和61.45%),显著优于如DetGeo等代表性方法(分别为61.97%、57.66%和54.05%)。消融研究表明,共享编码、查询引导的融合和网格级稀疏Mixture-of-Experts均带来了互补的提升。

关键词

引用

@article{arxiv.2511.14093,
  title  = {SMGeo: Cross-View Object Geo-Localization with Grid-Level Mixture-of-Experts},
  author = {Fan Zhang and Haoyuan Ren and Fei Ma and Qiang Yin and Yongsheng Zhou},
  journal= {arXiv preprint arXiv:2511.14093},
  year   = {2025}
}