MSMVD:基于多尺度 BEV 特征的多视角行人检测
计算机视觉与模式识别
2025-08-29 v1
摘要
多视角行人检测(MVPD)旨在以鸟瞰视角(BEV)形式检测行人。在 MVPD 中,端到端可训练的深度学习方法取得了大量进展。然而,这些方法常常难以检测在不同视角中尺度始终较小或较大,或在不同视角间尺度差异巨大的行人。这是因为它们未利用多尺度图像特征生成 BEV 特征进行行人检测。为克服此问题,我们提出一种新型 MVPD 方法,称为多尺度多视角检测(MSMVD)。MSMVD 通过将来自各个视角提取的多尺度图像特征按尺度逐层投影到 BEV 空间,从而生成多尺度 BEV 特征。这些 BEV 特征各自继承其对应尺度图像特征的属性。因此,这些 BEV 特征有助于精准检测在不同视角中尺度始终较小或较大的行人。随后,MSMVD 通过使用特征金字塔网络处理多尺度 BEV 特征,将多个视角在不同尺度上的信息进行融合,从而提高检测尺度差异巨大的行人的性能。广泛的实验表明,通过多尺度 BEV 特征利用多尺度图像特征显著提高了检测性能,MSMVD 在 GMVD 数据集上较前最高 MODA 提升了 分。
引用
@article{arxiv.2508.20447,
title = {MSMVD: Exploiting Multi-scale Image Features via Multi-scale BEV Features for Multi-view Pedestrian Detection},
author = {Taiga Yamane and Satoshi Suzuki and Ryo Masumura and Shota Orihashi and Tomohiro Tanaka and Mana Ihori and Naoki Makishima and Naotaka Kawata},
journal= {arXiv preprint arXiv:2508.20447},
year = {2025}
}
备注
Accepted by BMVC 2025