中文

VideoDG:将视频中的时序关系泛化至新域

计算机视觉与模式识别 2021-09-20 v2 机器学习

摘要

本文提出视频域泛化问题,其中大多数视频分类网络因未接触过分布不同的目标域而性能退化。我们观察到全局时序特征的可泛化性较差,这是由于时序域偏移——来自其他未见域的视频可能意外缺失或错位的时序关系所致。这一发现促使我们通过有效学习更具可泛化性的不同时序尺度的局部关系特征,并将其与全局关系特征结合使用以保持判别性,来解决视频域泛化问题。本文提出 VideoDG 框架,包含两项技术贡献。其一是名为对抗金字塔网络(Adversarial Pyramid Network)的新深度架构,它通过逐步捕获局部关系、全局关系与跨关系特征来提升视频特征的可泛化性。在金字塔特征基础上,第二项贡献是一种新颖且鲁棒的对抗数据增强方法,可通过提升增强数据的多样性与质量来桥接不同视频域。我们构建了三个视频域泛化基准,其域分别依据不同数据集、不同动作结果或不同相机视角划分。VideoDG 在所有基准上一致优于以往的视频分类模型与现有域泛化方法的组合。

关键词

引用

@article{arxiv.1912.03716,
  title  = {VideoDG: Generalizing Temporal Relations in Videos to Novel Domains},
  author = {Zhiyu Yao and Yunbo Wang and Jianmin Wang and Philip S. Yu and Mingsheng Long},
  journal= {arXiv preprint arXiv:1912.03716},
  year   = {2021}
}

备注

Accepted by IEEE TPAMI, 2021. Code: https://github.com/thuml/VideoDG