中文

用于发现序列视频数据组合结构的基于图割的图学习网络

机器学习 2020-01-22 v1 计算机视觉与模式识别 图像与视频处理 机器学习

摘要

循环神经网络(RNN)等传统序列学习方法关注连续输入之间的交互,即一阶马尔可夫依赖。然而,大多数序列数据(如视频)具有复杂的依赖结构,意味着变长语义流及其组合,这些难以被传统方法捕捉。在此,我们提出基于图割的图学习网络(CB-GLNs),通过发现视频的这些复杂结构来学习视频数据。CB-GLNs 将视频数据表示为图,节点和边分别对应视频帧及其依赖关系。CB-GLNs 通过带图割的参数化核与消息传递框架,以多级图形式找出数据的组合依赖。我们在两项不同的视频理解任务上评估所提方法:视频主题分类(Youtube-8M 数据集)和视频问答(TVQA 数据集)。实验结果表明,我们的模型高效学习了视频数据的语义组合结构。此外,与其他基线方法相比,我们的模型取得了最高性能。

关键词

引用

@article{arxiv.2001.07613,
  title  = {Cut-Based Graph Learning Networks to Discover Compositional Structure of Sequential Video Data},
  author = {Kyoung-Woon On and Eun-Sol Kim and Yu-Jung Heo and Byoung-Tak Zhang},
  journal= {arXiv preprint arXiv:2001.07613},
  year   = {2020}
}

备注

8 pages, 3 figures, Association for the Advancement of Artificial Intelligence (AAAI2020). arXiv admin note: substantial text overlap with arXiv:1907.01709