为多视角行人检测引入泛化能力
计算机视觉与模式识别
2022-03-15 v4
摘要
多视角检测(MVD)在拥挤环境中对遮挡推理极为有效。尽管近期基于深度学习的工作在该领域取得了显著进展,但它们忽视了泛化方面,这使其难以在实际场景中部署。我们工作的核心创新在于形式化了三种关键的泛化形式并提出实验以评估它们:即i)相机数量变化的泛化,ii)相机位置变化的泛化,以及iii)对新场景的泛化。我们发现现有最先进模型通过对单一场景和相机配置过拟合而表现出较差的泛化能力。为解决这些问题:(a)我们提出了一种新颖的泛化多视角检测(GMVD)数据集,融合了具有不同 daytime、相机配置、相机数量变化的多样场景;(b)我们讨论了为MVD带来泛化能力所必需的性质,并提出了一种融合这些性质的极简模型。我们在WildTrack、MultiViewX以及GMVD数据集上进行了全面的实验,以论证评估MVD方法泛化能力的必要性,并展示所提方法的有效性。代码与所提数据集可在 https://github.com/jeetv/GMVD 获取。
引用
@article{arxiv.2109.12227,
title = {Bringing Generalization to Deep Multi-View Pedestrian Detection},
author = {Jeet Vora and Swetanjal Dutta and Kanishk Jain and Shyamgopal Karthik and Vineet Gandhi},
journal= {arXiv preprint arXiv:2109.12227},
year = {2022}
}