中文

行人检测器从虚拟到真实的域适应

计算机视觉与模式识别 2020-09-22 v3 机器学习 图像与视频处理

摘要

通过计算机视觉进行行人检测是众多应用的基石。近来,基于卷积神经网络(CNN)的架构在执行此类任务上受到越来越多的关注。这些监督网络的关键目标之一,是将训练阶段学到的知识泛化到具有不同特性的新场景。为实现此目的,一个适当标注的数据集至关重要。主要问题在于,手动标注数据集通常需要大量人力且成本高昂。为此,我们引入 ViPeD(Virtual Pedestrian Dataset,虚拟行人数据集),这是一个利用视频游戏 GTA V(Grand Theft Auto V,侠盗猎车手 V)高度照片级真实图形引擎采集的新合成生成图像集,其标注自动获得。然而,当仅在合成数据集上训练时,模型会经历 Synthetic2Real(合成到真实)域偏移,导致应用于真实世界图像时性能下降。为缓解此差距,我们提出两种适用于行人检测任务但可能推广至一般目标检测的域适应(Domain Adaptation)技术。实验表明,用 ViPeD 训练的网络的泛化能力优于用真实世界数据训练的检测器,这得益于我们合成数据集的多样性。此外,我们证明借助所提域适应技术,可减小 Synthetic2Real 域偏移,使两个域更为接近,并在真实世界图像上测试网络时获得性能提升。代码、模型与数据集已在 https://ciampluca.github.io/viped/ 免费提供。

关键词

引用

@article{arxiv.2001.03032,
  title  = {Virtual to Real adaptation of Pedestrian Detectors},
  author = {Luca Ciampi and Nicola Messina and Fabrizio Falchi and Claudio Gennaro and Giuseppe Amato},
  journal= {arXiv preprint arXiv:2001.03032},
  year   = {2020}
}