基于模态回归与多模态 IoU 的大失配多模态行人检测
计算机视觉与模式识别
2021-07-26 v1
摘要
多模态的联合使用通过共同利用这些模态中的高可见度区域,实现了在光照条件较差情况下的准确行人检测。这种联合使用的关键假设是两种模态之间没有失配或仅有微弱失配。然而,通常情况下,这一假设在实际场景中经常失效。由于该假设失效,两种模态之间的边界框位置不匹配,导致检测精度显著下降,尤其是在失配量较大的区域。本文提出了一种对大失配具有鲁棒性的多模态 Faster-RCNN。其关键是 1) 模态回归和 2) 用于 mini-batch 采样的多模态 IoU。为了处理大失配,我们在 RPN 和检测头中使用两种模态进行边界框回归。我们还提出了一种名为“多模态 mini-batch 采样”的新采样策略,该策略整合了两种模态的 IoU。通过实际图像实验,我们证明了所提方法在处理大失配数据时的性能远优于 state-of-the-art 方法。
关键词
引用
@article{arxiv.2107.11196,
title = {Multi-Modal Pedestrian Detection with Large Misalignment Based on Modal-Wise Regression and Multi-Modal IoU},
author = {Napat Wanchaitanawong and Masayuki Tanaka and Takashi Shibata and Masatoshi Okutomi},
journal= {arXiv preprint arXiv:2107.11196},
year = {2021}
}
备注
Accepted by MVA2021