中文

视频只需注意力:基于通用Transformer的自注意力视频摘要

计算机视觉与模式识别 2019-06-10 v1

摘要

近年来,由于序列建模的进步以及长短期记忆网络(LSTM)的复兴和门控循环单元(GRU)的引入,视频字幕与摘要变得非常流行。现有架构使用CNN提取时空特征,并利用GRU或LSTM通过软注意力层建模依赖关系。这些注意力层确实有助于关注最显著特征并改进循环单元,然而这些模型受限于循环单元自身的固有缺陷。Transformer模型的引入将序列建模领域推向了新方向。在本项目中,我们实现了一种基于Transformer的视频字幕模型,利用C3D和双流I3D等3D CNN架构进行视频提取。我们还应用了若干降维技术以将模型整体规模控制在限度内。我们最终在MSVD和ActivityNet数据集上分别给出了单句与稠密视频字幕任务的结果。

关键词

引用

@article{arxiv.1906.02792,
  title  = {Attention is all you need for Videos: Self-attention based Video Summarization using Universal Transformers},
  author = {Manjot Bilkhu and Siyang Wang and Tushar Dobhal},
  journal= {arXiv preprint arXiv:1906.02792},
  year   = {2019}
}

备注

15 pages, 10 figures