中文

行人检测:域泛化、CNN、Transformer 及超越

计算机视觉与模式识别 2022-03-03 v2

摘要

行人检测是许多基于视觉应用的基石,从目标跟踪到视频监控,以及近期的自动驾驶。随着深度学习在目标检测中的快速发展,行人检测在传统的单数据集训练与评估设定下已取得非常好的性能。然而,在本项关于可泛化行人检测器的研究中,我们表明当前的行人检测器在跨数据集评估中即便面对微小的域偏移也表现不佳。我们将有限的泛化能力归因于两个主要因素:方法与当前数据来源。在方法方面,我们阐明当前行人检测器设计选择(如锚框设置)中存在的偏置是导致泛化受限的主要因素。大多数现代行人检测器是针对目标数据集定制的,它们在传统的单训练与测试流程中确实能达到高性能,但在跨数据集评估时性能下降。因此,由于其通用设计,通用目标检测器在跨数据集评估中的表现优于最先进的(state-of-the-art, SOTA)行人检测器。至于数据,我们表明自动驾驶基准本质上单调,即场景不多样且行人不密集。因此,通过爬取网络整理的基准(包含多样且密集的场景)可作为提供更具鲁棒表示的高效预训练来源。相应地,我们提出一种渐进式微调策略以提升泛化能力。代码与模型可在 https://github.com/hasanirtiza/Pedestron 获取。

关键词

引用

@article{arxiv.2201.03176,
  title  = {Pedestrian Detection: Domain Generalization, CNNs, Transformers and Beyond},
  author = {Irtiza Hasan and Shengcai Liao and Jinpeng Li and Saad Ullah Akram and Ling Shao},
  journal= {arXiv preprint arXiv:2201.03176},
  year   = {2022}
}

备注

13 pages