中文

看见未被看见:基于掩码驱动的位置编码与条形卷积上下文建模的跨视图物体地理定位

计算机视觉与模式识别 2025-10-24 v1

摘要

跨视图物体地理定位通过跨视图匹配实现高精度物体定位,具有自动驾驶、城市管理和灾害应急等关键应用。然而,现有方法依赖基于关键点的位置编码,仅捕获二维坐标,忽略物体形状信息,导致对标注位移敏感且跨视图匹配能力受限。为此,我们提出基于掩码的位置编码方案,利用分割掩码捕获空间坐标与物体轮廓,从而将模型从“位置感知”提升至“物体感知”。此外,针对卫星图像中大跨度物体(如延伸建筑)的挑战,我们设计上下文增强模块。该模块采用水平和垂直条形卷积核提取长程上下文特征,增强条形物体的特征辨别能力。整合MPE与CEM,我们提出EDGeo框架,用于稳健的跨视图物体地理定位。在两个公开数据集(CVOGL和VIGOR-Building)上的大量实验表明,我们的方法在具有挑战性的地面到卫星场景中实现了既定性能提升,其中定位精度提升3.39%。本工作为跨视图地理定位研究提供了稳健的位置编码范式和上下文建模框架。

关键词

引用

@article{arxiv.2510.20247,
  title  = {Seeing the Unseen: Mask-Driven Positional Encoding and Strip-Convolution Context Modeling for Cross-View Object Geo-Localization},
  author = {Shuhan Hu and Yiru Li and Yuanyuan Li and Yingying Zhu},
  journal= {arXiv preprint arXiv:2510.20247},
  year   = {2025}
}