中文

基于合成数据的像素级人群理解

计算机视觉与模式识别 2020-08-04 v2

摘要

基于计算机视觉技术的人群分析是视频监控领域的重要课题,具有人群监控、公共安全、空间设计等广泛应用。像素级人群理解因对视频序列或静态图像给出比其他分析任务更精细的结果,是人群分析中最基础的任务。遗憾的是,像素级理解需要大量标注训练数据。标注工作昂贵,导致现有人群数据集规模较小。因此,多数算法不同程度地存在过拟合问题。本文以像素级人群理解中的人群计数与分割为例,尝试从数据与方法论两方面补救这些问题。首先,我们开发了一个免费的数据采集与标注器,在计算机游戏《侠盗猎车手V》中生成合成且已标注的人群场景,并据此构建了一个大规模、多样化的合成人群数据集,命名为“GCC数据集”。其次,我们提出两种利用合成数据提升人群理解性能的简易方法。具体而言:1)有监督人群理解:在合成数据上预训练人群分析模型,再用真实数据与标签微调,使模型在真实世界中表现更好;2)基于域适应的人群理解:将合成数据转换为照片级真实图像,再在转换后数据及标签上训练模型。由此,训练所得模型在真实人群场景中表现良好。

关键词

引用

@article{arxiv.2007.16032,
  title  = {Pixel-wise Crowd Understanding via Synthetic Data},
  author = {Qi Wang and Junyu Gao and Wei Lin and Yuan Yuan},
  journal= {arXiv preprint arXiv:2007.16032},
  year   = {2020}
}

备注

Accepted by IJCV. arXiv admin note: text overlap with arXiv:1903.03303