中文

无对齐 RGBT 视频目标检测的多模态时空图学习

计算机视觉与模式识别 2025-04-17 v1

摘要

RGB-热视频目标检测(RGBT VOD)可解决传统基于 RGB 的 VOD 在恶劣照明条件下的局限性,使其在许多应用场景中更实用且有效。然而,类似于大多数 RGBT 融合任务,仍主要依赖手动对齐的多模态图像对。在本文中,我们提出了一种 novel 的多模态时空图学习网络(MSGNet),用于解决无对齐 RGBT VOD 问题,具体通过利用鲁棒的图表示学习模型实现。具体而言,我们首先设计了自适应分区层(APL),用于估计热图在 RGB 图中的对应区域(高分辨率),实现初步的非精确对齐。随后,我们引入空间稀疏图学习模块(S-SGLM),其采用稀疏信息传递机制于估计的非精确对齐上,以实现不同模态之间的可靠信息交互。此外,为充分利用 RGBT VOD 的时序线索,我们引入混合结构时序建模(HSTM),其中包括时序稀疏图学习模块(T-SGLM)和时序星形模块(TSB)。T-SGLM 旨在通过对时序图采用稀疏聚合机制,以过滤相邻帧之间的冗余信息。而 TSB 则致力于实现局部空间关系的互补学习。对在对齐数据集 VT-VOD50 和非对齐数据集 UVT-VOD2024 上进行的大量比较实验表明,我们所提出的方法在有效性和优越性方面具有显著优势。我们的项目将在我们网站上免费公开供公众访问。

关键词

引用

@article{arxiv.2504.11779,
  title  = {Multimodal Spatio-temporal Graph Learning for Alignment-free RGBT Video Object Detection},
  author = {Qishun Wang and Zhengzheng Tu and Chenglong Li and Bo Jiang},
  journal= {arXiv preprint arXiv:2504.11779},
  year   = {2025}
}