中文

用于从图像学习视频目标检测器的无监督对抗视觉级域适应

计算机视觉与模式识别 2018-10-05 v1

摘要

基于深度学习的目标检测器需要数千张带有多样化边界框与类别标注的示例。尽管随着多个大规模静态图像数据集的发布,图像目标检测器近年来进展迅速,但由于标注视频帧的稀缺,视频目标检测仍是一个开放问题。拥有鲁棒的视频目标检测器是视频理解与在视频中生成大规模自动标注的关键组件。图像与视频间的域差异使得图像目标检测器向视频的迁移性能欠佳。最常见的解决方案是使用弱监督标注,即视频帧必须标注物体类别的存在/缺失。这仍耗费人工。本文中,我们通过将无监督对抗图像到图像翻译的概念应用于扰动静态高质量图像,使其视觉上与一组视频帧无法区分,从而向前推进一步。我们假设存在一个完全标注的静态图像数据集和一个未标注的视频数据集。目标检测器使用原始数据集的标注在对抗变换后的图像数据集上训练。在两个当代基线目标检测器上对 Youtube-Objects 与 Youtube-Objects-Subset 数据集的实验表明,相较于直接应用原始图像目标检测器,这种无监督像素级域适应提升了在视频帧上的泛化性能。此外,我们取得了与近期弱监督方法基线相竞争的性能。本文可视为图像翻译用于跨域目标检测的应用。

关键词

引用

@article{arxiv.1810.02074,
  title  = {Unsupervised Adversarial Visual Level Domain Adaptation for Learning Video Object Detectors from Images},
  author = {Avisek Lahiri and Charan Reddy and Prabir Kumar Biswas},
  journal= {arXiv preprint arXiv:1810.02074},
  year   = {2018}
}

备注

* First two authors contributed equally