中文

通过数据增强学习时间不变且可定位的特征用于视频识别

计算机视觉与模式识别 2020-08-14 v1

摘要

基于深度学习的视频识别随着大规模数据集与时空网络架构的发展已展现出可喜的改进。在图像识别中,学习空间不变特征是提升识别性能与鲁棒性的关键因素。基于视觉归纳先验(如裁剪、翻转、旋转或光度抖动)的数据增强是实现这些特征的典型方法。近期最先进的识别方案依赖于利用多种增强操作混合的现代数据增强策略。在本研究中,我们将这些策略扩展到视频的时间维度,以学习时间不变或时间可定位特征,从而覆盖视频中的时间扰动或复杂动作。基于我们新颖的时间数据增强算法,仅使用有限量的训练数据,视频识别性能便优于仅空间的数据增强算法,包括首届面向数据高效动作识别挑战的视觉归纳先验(VIPriors)。此外,学到的特征具有时间可定位性,这是空间增强算法无法实现的。我们的源代码可在 https://github.com/taeoh-kim/temporal_data_augmentation 获取。

关键词

引用

@article{arxiv.2008.05721,
  title  = {Learning Temporally Invariant and Localizable Features via Data Augmentation for Video Recognition},
  author = {Taeoh Kim and Hyeongmin Lee and MyeongAh Cho and Ho Seong Lee and Dong Heon Cho and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2008.05721},
  year   = {2020}
}

备注

European Conference on Computer Vision (ECCV) 2020, 1st Visual Inductive Priors for Data-Efficient Deep Learning Workshop (Oral)