利用长时程时间动态进行视频描述生成
计算机视觉与模式识别
2022-02-23 v1
摘要
用自然语言自动描述视频是计算机视觉与自然语言处理的一项基本挑战。近来,该问题通过两步取得了进展:1) 采用二维和/或三维卷积神经网络(CNN,如 VGG、ResNet 或 C3D)提取空间与/或时间特征以编码视频内容;2) 应用循环神经网络(RNN)生成句子以描述视频中的事件。基于时间注意力的模型通过考虑每帧视频的重要性获得了很大进展。然而,对于长视频,尤其是由一组子事件构成的视频,我们应发现并利用每个子镜头而非每帧的重要性。本文提出一种新方法,即时间与空间 LSTM(TS-LSTM),系统性地挖掘视频序列中的空间与时间动态。在 TS-LSTM 中,设计了一种时间池化 LSTM(TP-LSTM)以融合空间与时间信息来提取视频子镜头内的长时程时间动态;并引入一个堆叠 LSTM 来生成描述视频的词序列。在两个公开视频描述生成基准上的实验结果表明,我们的 TS-LSTM 优于当前最优(SOTA)方法。
引用
@article{arxiv.2202.10828,
title = {Exploiting long-term temporal dynamics for video captioning},
author = {Yuyu Guo and Jingqiu Zhang and Lianli Gao},
journal= {arXiv preprint arXiv:2202.10828},
year = {2022}
}