利用时间结构描述视频
机器学习
2015-10-02 v5 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
最近在使用循环神经网络(RNN)进行图像描述方面的进展激励了将其应用于视频描述的探索。然而,尽管图像是静态的,处理视频需要对它们动态的时序结构进行建模,然后将该信息恰当地整合到自然语言描述中。在此背景下,我们提出了一种成功考虑视频局部和全局时间结构以生成描述的方法。首先,我们的方法结合了短时序动力学的时空三维卷积神经网络(3-D CNN)表示。该3-D CNN表示在视频动作识别任务上训练,以产生针对人体运动和行为调整的表示。其次,我们提出一种时间注意力机制,该机制允许超越局部时间建模,并学习在给定文本生成RNN的情况下自动选择最相关的时间段。我们的方法在Youtube2Text数据集上超越了当前最佳的BLEU和METEOR指标。我们还在一个新的、更大且更具挑战性的配对视频与自然语言描述数据集上给出了结果。
引用
@article{arxiv.1502.08029,
title = {Describing Videos by Exploiting Temporal Structure},
author = {Li Yao and Atousa Torabi and Kyunghyun Cho and Nicolas Ballas and Christopher Pal and Hugo Larochelle and Aaron Courville},
journal= {arXiv preprint arXiv:1502.08029},
year = {2015}
}
备注
Accepted to ICCV15. This version comes with code release and supplementary material