中文

行人检测遇多模态学习:通用模型与基准数据集

计算机视觉与模式识别 2024-07-16 v1

摘要

近年来,随着不同传感器模态(如 RGB、IR、Depth、LiDAR 和 Event)优势的不断被利用,人们对利用多模态数据进行行人检测的研究注意力不断增加。然而,设计一个能有效处理多种传感器模态输入的统一通用模型仍然是一个挑战。本文引入了 MMPedestron,这是一个新的多模态感知通用模型。不同于以前仅处理一种或两种特定模态输入的专家模型,MMPedestron 能够处理多种模态输入及其动态组合。该方法包括用于模态表征和融合的统一编码器,以及用于行人检测的通用头部。我们引入两个额外的可学习标记,即 MAA 和 MAF,用于自适应多模态特征融合。此外,我们构建了 MMPD 数据集,这是第一个大规模的多模态行人检测基准数据集。该基准整合了现有公开数据集以及一个新收集的数据集 EventPed,涵盖了包括 RGB、IR、Depth、LiDAR 和 Event 数据在内的广泛传感器模态。通过多模态联合训练,我们的模型在广泛的行人检测基准测试中实现了领先模型的业绩,后者是针对特定传感器模态量身定制的。例如,在 COCO-Persons 上达到了 71.1 的 AP,在 LLVIP 上达到了 72.6 的 AP。值得注意的是,我们的模型在 CrowdHuman 上仅使用 30 倍更小的参数,即可达到 InternImage-H 模型的相当性能。代码和数据已在 https://github.com/BubblyYi/MMPedestron 上提供。

关键词

引用

@article{arxiv.2407.10125,
  title  = {When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset},
  author = {Yi Zhang and Wang Zeng and Sheng Jin and Chen Qian and Ping Luo and Wentao Liu},
  journal= {arXiv preprint arXiv:2407.10125},
  year   = {2024}
}

备注

Accepted to ECCV'2024