面向跨域遥感视觉定位的OptiSAR-Net++:大规模基准与无Transformer框架
计算机视觉与模式识别
2026-03-27 v1
摘要
遥感视觉定位(RSVG)旨在使用自然语言表达式在遥感图像中定位特定目标。然而,现有方法局限于单一传感器领域,即光学或合成孔径雷达(SAR),限制了其实际应用。本文引入了跨域RSVG(CD-RSVG)任务,构建OptSAR-RSVG——首个大规模跨域RSVG基准数据集。为解决跨域特征建模、计算效率和细粒度语义判别的挑战,我们提出OptiSAR-Net++。该框架采用基于Patch级别的低秩适应混合专家(PL-MoE)实现高效的跨域特征解耦。为缓解Transformer解码框架的计算开销,我们采用CLIP基准的对比范式,并引入动态对抗负采样,将生成式回归转化为高效的跨模态匹配过程。此外,引入文本引导的双关融合模块(TGDF-SSA)和区域感知辅助头,以增强语义-视觉对齐和空间建模。广泛实验表明,OptiSAR-Net++在OptSAR-RSVG和DIOR-RSVG基准上实现SOTA性能,在定位精度和效率方面均具有显著优势。我们的代码和数据集将公开提供。
关键词
引用
@article{arxiv.2603.24876,
title = {OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding},
author = {Xiaoyu Tang and Jun Dong and Jintao Cheng and Rui Fan},
journal= {arXiv preprint arXiv:2603.24876},
year = {2026}
}