中文

面向异构多模态遥感检测的语言枢纽预训练统一框架

计算机视觉与模式识别 2026-03-03 v1

摘要

异构多模态遥感目标检测旨在从多种传感器(如 RGB、SAR、红外)中准确检测目标。现有方法大多采用晚期对齐范式,即在下游微调期间将模态对齐与任务特定优化 entangled,这导致优化复杂化,常引发训练不稳定和泛化性能 suboptimal。为此,我们提出 BabelRS,一个基于语言枢纽的预训练框架,显式解耦模态对齐与下游任务学习。BabelRS 包含两个关键组件:概念共享指令对齐(CSIA)和层级视觉-语义退火(LVSA)。CSIA 将每个传感器模态对齐到共享的语言概念集合中,使用语言作为语义枢纽桥接异构视觉表征。为进一步缓解高级语言表征与稠密检测目标之间的细粒度不匹配,LVSA 渐进式聚合多尺度视觉特征以提供细粒度语义指导。广泛实验表明,BabelRS 在训练稳定性方面优于最先进的方法,且无需额外技巧即可实现性能提升。代码:https://github.com/zcablii/SM3Det。

关键词

引用

@article{arxiv.2603.01758,
  title  = {Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining},
  author = {Yuxuan Li and Yuming Chen and Yunheng Li and Ming-Ming Cheng and Xiang Li and Jian Yang},
  journal= {arXiv preprint arXiv:2603.01758},
  year   = {2026}
}