中文

面向序列视频数据的组合结构学习

机器学习 2019-07-04 v1 计算机视觉与模式识别 图像与视频处理 机器学习

摘要

循环神经网络(RNNs)等传统序列学习方法关注连续输入之间的交互,即一阶马尔可夫依赖。然而,大多数序列数据(如视频)具有复杂的时间依赖,意味着变长语义流及其组合,这些难以被传统方法捕捉。本文提出时间依赖网络(TDNs)用于通过学习视频的这些复杂结构来处理视频数据。TDNs将视频表示为图,其节点和边分别对应视频帧及其依赖关系。通过带图割和图卷积的参数化核,TDNs以多级图形式发现数据的组合时间依赖。我们在大规模视频数据集Youtube-8M上评估所提方法。实验结果表明,我们的模型高效学习了视频数据的复杂语义结构。

关键词

引用

@article{arxiv.1907.01709,
  title  = {Compositional Structure Learning for Sequential Video Data},
  author = {Kyoung-Woon On and Eun-Sol Kim and Yu-Jung Heo and Byoung-Tak Zhang},
  journal= {arXiv preprint arXiv:1907.01709},
  year   = {2019}
}