中文

面向多模态目标检测的弱对齐特征融合

计算机视觉与模式识别 2022-04-22 v1

摘要

为在真实场景中实现准确且鲁棒的目标检测,人们引入了多种形式图像,如彩色、热红外与深度图像。然而,多模态数据常受位置偏移问题困扰,即图像对未严格对齐,使得同一物体在不同模态中位置不同。对深度学习方法而言,该问题导致多模态特征难以融合,并困扰卷积神经网络(CNN)的训练。本文提出一种通用多模态检测器,称为对齐区域 CNN(AR-CNN),以解决位置偏移问题。首先,设计带相邻相似性约束的区域特征(RF)对齐模块,一致地预测两模态间位置偏移并自适应对齐跨模态 RF。其次,提出一种新颖的兴趣区域(RoI)抖动策略以提升对意外偏移模式的鲁棒性。第三,提出一种新的多模态特征融合方法,通过特征重加权选择更可靠特征并抑制较无用特征。此外,通过在两模态中定位边界框并建立其关联,我们提供了名为 KAIST-Paired 的新颖多模态标注。在二维与三维目标检测、RGB-T 及 RGB-D 数据集上的大量实验证明了方法的有效性与鲁棒性。

关键词

引用

@article{arxiv.2204.09848,
  title  = {Weakly Aligned Feature Fusion for Multimodal Object Detection},
  author = {Lu Zhang and Zhiyong Liu and Xiangyu Zhu and Zhan Song and Xu Yang and Zhen Lei and Hong Qiao},
  journal= {arXiv preprint arXiv:2204.09848},
  year   = {2022}
}

备注

Journal extension of the previous conference paper arXiv:1901.02645, see IEEE page https://ieeexplore.ieee.org/document/9523596