中文

利用语义分割提升地面至空中图像匹配——用于视觉误信息检测的 Quadruple Semantic Align Net

计算机视觉与模式识别 2025-02-25 v3

摘要

生成式 AI 技术的 recent 进展显著增加了altered图像和视频的在线传播,引发了对互联网上数字媒体可信度的严重关切,这些媒体通过信息渠道和社交网络分发。在依赖可信数据的数据密集型领域(如新闻、司法鉴定和地球观测)尤其受此影响。为解决这些问题,无需外部信息(如 GPS 坐标)对非 GPS 标记的地面视图图像进行地理定位的能力变得越来越关键。本研究针对挑战在于将可能具有不同视场(FoV)的地面视图图像与其对应的卫星图像链接而不使用 GPS 数据而提出了方法。为实现此目标,我们提出了一种新型四流类 Siamese 架构——Quadruple Semantic Align Net (SAN-QUAD),该网络延续了之前的最新(SOTA)方法,利用对地面和卫星图像应用语义分割。在 CVUSA 数据集的子集上进行的实验结果表明,在各种 FoV 设置下,本方法相较于先前方法实现了最高可达 9.8% 的显著性提升。

关键词

引用

@article{arxiv.2502.06288,
  title  = {Enhancing Ground-to-Aerial Image Matching for Visual Misinformation Detection Using Semantic Segmentation},
  author = {Emanuele Mule and Matteo Pannacci and Ali Ghasemi Goudarzi and Francesco Pro and Lorenzo Papa and Luca Maiano and Irene Amerini},
  journal= {arXiv preprint arXiv:2502.06288},
  year   = {2025}
}

备注

9 pages, 4 figures. Accepted to AI4MFDD 2025 workshop at WACV 2025