中文

利用网络监督的图像到视频域适应

计算机视觉与模式识别 2019-08-06 v1

摘要

训练深度神经网络通常需要大量标注数据,而针对特定目标域这类数据可能稀缺或获取成本高昂。作为替代,我们可以利用网络监督数据(即公开搜索引擎的结果),其相对丰富但可能包含噪声结果。本工作中,我们提出一种利用网络监督数据学习视频分类器的新型两阶段方法。我们认为,先学习外观特征再学习时序特征的顺序学习方式,比同时学习更易优化。我们首先从网络图像学习图像模型,并用其初始化和训练视频模型,从而证明这一点。我们的模型应用域适应以处理源域(网络监督数据)与目标域间潜在的域偏移,并通过添加一种新型注意力组件来处理噪声。我们在 UCF-101 上报告了与最先进网络监督方法相竞争的结果(同时简化了训练过程),并在 Kinetics 上进行了对比评估。

关键词

引用

@article{arxiv.1908.01449,
  title  = {Image to Video Domain Adaptation Using Web Supervision},
  author = {Andrew Kae and Yale Song},
  journal= {arXiv preprint arXiv:1908.01449},
  year   = {2019}
}