用于多视角检测的三维体素化特征聚合
计算机视觉与模式识别
2023-01-05 v2
摘要
多视角检测结合多个相机视角以缓解拥挤场景中的遮挡,其中最先进的方法采用单应性变换将多视角特征投影到地平面。然而,我们发现这些二维变换未考虑物体高度,由于该忽略,同一物体沿垂直方向的特征可能未被投影到同一地平面点,导致地平面特征不纯。为解决此问题,我们提出 VFA,即体素化三维特征聚合,用于多视角检测中的特征变换与聚合。具体而言,我们对三维空间进行体素化,将体素投影到各相机视角,并将二维特征与这些投影体素关联。这使我们能够识别并聚合同一垂直线上的二维特征,大幅减轻投影畸变。此外,由于不同物体(人 vs. 牛)在地平面上的形状不同,我们引入有向高斯编码以匹配此类形状,从而提高精度与效率。我们在多视角二维检测与多视角三维检测问题上进行实验。在四个数据集(包括新引入的 MultiviewC 数据集)上的结果表明,我们的系统相较最先进方法极具竞争力。代码与 MultiviewC 发布于 https://github.com/Robert-Mar/VFA。
引用
@article{arxiv.2112.03471,
title = {Voxelized 3D Feature Aggregation for Multiview Detection},
author = {Jiahao Ma and Jinguang Tong and Shan Wang and Wei Zhao and Zicheng Duan and Chuong Nguyen},
journal= {arXiv preprint arXiv:2112.03471},
year = {2023}
}