中文

基于模态回归与多模态 IoU 的大失配多模态行人检测

计算机视觉与模式识别 2021-07-26 v1

摘要

多模态的联合使用通过共同利用这些模态中的高可见度区域,实现了在光照条件较差情况下的准确行人检测。这种联合使用的关键假设是两种模态之间没有失配或仅有微弱失配。然而,通常情况下,这一假设在实际场景中经常失效。由于该假设失效,两种模态之间的边界框位置不匹配,导致检测精度显著下降,尤其是在失配量较大的区域。本文提出了一种对大失配具有鲁棒性的多模态 Faster-RCNN。其关键是 1) 模态回归和 2) 用于 mini-batch 采样的多模态 IoU。为了处理大失配,我们在 RPN 和检测头中使用两种模态进行边界框回归。我们还提出了一种名为“多模态 mini-batch 采样”的新采样策略,该策略整合了两种模态的 IoU。通过实际图像实验,我们证明了所提方法在处理大失配数据时的性能远优于 state-of-the-art 方法。

关键词

引用

@article{arxiv.2107.11196,
  title  = {Multi-Modal Pedestrian Detection with Large Misalignment Based on Modal-Wise Regression and Multi-Modal IoU},
  author = {Napat Wanchaitanawong and Masayuki Tanaka and Takashi Shibata and Masatoshi Okutomi},
  journal= {arXiv preprint arXiv:2107.11196},
  year   = {2021}
}

备注

Accepted by MVA2021