中文

SLGNet:结构先验与语言引导调制的协同设计用于多模态目标检测

计算机视觉与模式识别 2026-01-06 v1

摘要

利用 RGB 和红外(IR)图像进行的多模态目标检测对于实现所有天气条件下的稳健感知至关重要。虽然最近的基于适配器的方法有效地将 RGB 预训练的基础模型迁移到此任务,但它们往往在跨模态结构一致性方面优先考虑模型效率,牺牲了显式的结构一致性。因此,在高对比度或夜间环境等显著域间差异出现时,关键结构线索常被丢失。此外,传统的静态多模态融合机制通常缺乏环境感知能力,在复杂动态场景变化下导致适应不足和检测性能受限。为解决这些问题,我们提出了 SLGNet,一个在冻结的 Vision Transformer(ViT)基础模型上实现的参数高效框架,协同利用层次化结构先验和语言引导调制。具体而言,我们设计了结构感知适配器,从两种模态中提取层次化结构表征,并动态注入 ViT 中以补偿 ViT 基础 backbone 本身固有的结构退化。进一步,我们提出了语言引导调制模块,利用 VLM 生成的结构化描述文本动态 recalibrate 视觉特征,从而赋予模型具备稳健环境感知能力。大量实验在 LLVIP、FLIR、KAIST 和 DroneVehicle 数据集上表明,SLGNet 建立了新的状态-of-the-art 性能。值得注意的是,在 LLVIP 数据集上,我们的方法实现了 66.1 的 mAP,而相较于传统全参数微调,可减少约 87% 的可训练参数。这确认了 SLGNet 作为多模态感知的稳健且高效解决方案。

关键词

引用

@article{arxiv.2601.02249,
  title  = {SLGNet: Synergizing Structural Priors and Language-Guided Modulation for Multimodal Object Detection},
  author = {Xiantai Xiang and Guangyao Zhou and Zixiao Wen and Wenshuai Li and Ben Niu and Feng Wang and Lijia Huang and Qiantong Wang and Yuhan Liu and Zongxu Pan and Yuxin Hu},
  journal= {arXiv preprint arXiv:2601.02249},
  year   = {2026}
}