用于深度多摄像头行人定位的 3D 随机遮挡与多层投影
计算机视觉与模式识别
2022-07-26 v2
摘要
尽管基于深度学习的单目行人检测方法已取得很大进展,但它们仍易受严重遮挡的影响。利用多视角信息融合是一种潜在解决方案,但由于现有多视角数据集中缺乏标注训练样本,其应用有限,这增加了过拟合风险。为解决该问题,本文提出一种数据增强方法,用于在地面平面上随机生成平均尺寸与行人相当的 3D 圆柱体遮挡,并将其投影到多个视角,以缓解训练中的过拟合影响。此外,利用单应矩阵将每个视角的特征图投影到不同高度上的多个平行平面,使 CNN 能够充分利用每个行人高度方向上的特征来推断其在地面平面上的位置。所提出的 3DROM 方法相较于最先进的基于深度学习的多视角行人检测方法,性能有大幅提升。
引用
@article{arxiv.2207.10895,
title = {3D Random Occlusion and Multi-Layer Projection for Deep Multi-Camera Pedestrian Localization},
author = {Rui Qiu and Ming Xu and Yuyao Yan and Jeremy S. Smith and Xi Yang},
journal= {arXiv preprint arXiv:2207.10895},
year = {2022}
}