面向光学和 SAR 图像的文本语义辅助跨模态图像配准框架 TAR
计算机视觉与模式识别
2026-05-13 v1
摘要
现有的深度学习方法可以捕获光学图像和合成孔径雷达(SAR)图像之间的共享特征,用于空间对齐。然而,在大尺度几何形变下,光学-SAR 配准仍然具有挑战性,因为模型需要同时处理跨模态外观差异和复杂的空间变换。为此,本文提出一种文本语义辅助的跨模态图像配准框架,命名为 TAR,用于光学和 SAR 图像。TAR 利用遥感场景和栅格类别的文本语义先验,以缓解模态差距并增强跨模态特征学习。TAR 包含三个组件:多尺度视觉特征学习(MSFL)模块、文本辅助特征增强(TAFE)模块和粗到细密集匹配(CFDM)模块。MSFL 从光学和 SAR 图像中提取多尺度视觉特征。TAFE 构建与遥感场景和栅格对象相关的文本描述符,并使用冻结的 RemoteCLIP 文本编码器提取文本特征。这些文本特征通过视觉-文本交互引入,以增强高层视觉特征,以实现更可靠的粗略匹配。CFDM 然后基于增强后的高层特征建立粗略对应关系,并使用低层特征细化匹配位置。实验结果表明,TAR 在跨模态遥感图像上有效,优于多个最先进方法,在大尺度几何形变下取得显著提升。
引用
@article{arxiv.2605.12064,
title = {TAR: Text Semantic Assisted Cross-modal Image Registration Framework for Optical and SAR Images},
author = {Zhuoyu Cai and Dou Quan and Ning Huyan and Pei He and Shuang Wang and Licheng Jiao},
journal= {arXiv preprint arXiv:2605.12064},
year = {2026}
}