深度时间线性编码网络
计算机视觉与模式识别
2016-11-22 v1
摘要
从整个视频中提取 CNN 编码特征以表征人类动作的研究鲜有涉及。相反,CNN 的工作主要集中在融合空间与时间网络的方法上,但这些方法通常局限于处理较短序列。我们提出了一种新的视频表征方法,称为时间线性编码,并作为新层嵌入 CNN 中,该方法能够捕捉整个视频中的外观与运动信息。它通过端到端学习将这一聚合信息编码为鲁棒的视频特征表征。TLE 的优势在于: 它将整个视频编码为紧凑的特征表征,学习语义信息与具有判别性的特征空间; 适用于 2D 与 3D CNN 等各类用于视频分类的网络; 以更具表达力且不丢失信息的方式对特征交互进行建模。我们在两个具有挑战性的人类动作数据集 HMDB51 和 UCF101 上进行了实验。实验表明,TLE 在这两个数据集上均优于当前 SOTA 方法。
引用
@article{arxiv.1611.06678,
title = {Deep Temporal Linear Encoding Networks},
author = {Ali Diba and Vivek Sharma and Luc Van Gool},
journal= {arXiv preprint arXiv:1611.06678},
year = {2016}
}
备注
Ali Diba and Vivek Sharma contributed equally to this work and listed in alphabetical order