中文

面向无对齐 RGBT 视频目标检测的尺度专家混合网络及统一基准

计算机视觉与模式识别 2025-04-21 v2

摘要

现有的 RGB-热视频目标检测(RGBT VOD)方法主要依赖图像对的手动对齐,这既费时费力又不易扩展,严重限制了这些方法在实际场景中的可行性。为此,本文提出一种新框架,称为混合尺度专家网络(Mixture of Scale Experts Network, MSENet)。MSENet 集成了在不同感知尺度上训练的多个专家,能够在无需显式对齐的情况下捕捉 RGB 与热图对之间的尺度差异。具体而言,为解决尺度未对齐问题,MSENet 引入一组专家,旨在跨越多个尺度感知 RGBT 图像对之间的相关性,这些专家能够识别并量化图像对固有的尺度差异。随后,引入动态路由机制,为每个专家分配自适应权重,使网络能够根据输入数据的特定特征动态选择最合适的专家。为解决位置未对齐问题,本文将可变形卷积引入网络中,通过学习 RGB 与热图模态之间的位置位移,来减轻空间未对齐的影响。为提供评估无对齐 RGBT VOD的全面平台,本文引入了新的基准数据集。该数据集涵盖 11 种常见物体类别,包含 60,988 张图像和 271,835 个目标实例。该数据集涵盖来自日常生活和自然环境的广泛场景,确保了高的内容多样性和复杂性。

关键词

引用

@article{arxiv.2410.12143,
  title  = {Mixture of Scale Experts for Alignment-free RGBT Video Object Detection and A Unified Benchmark},
  author = {Qishun Wang and Zhengzheng Tu and Kunpeng Wang and Le Gu and Chuanwang Guo},
  journal= {arXiv preprint arXiv:2410.12143},
  year   = {2025}
}