视频的记忆增强注意力建模
计算机视觉与模式识别
2017-04-25 v4 机器学习
神经与进化计算
摘要
我们提出了一种通过建模视频帧与描述概念之间的高阶交互来改进视频描述生成的方法。通过存储与先前生成单词相关联的视频中的过去视觉注意力,系统能够根据其已经观看和描述的内容来决定观看并描述什么。这不仅实现了更有效的局部注意力,而且在对每个单词生成时能对视频序列进行易处理的考量。在具有挑战性且流行的MSVD和Charades数据集上的评估表明,所提出的架构在不需要外部时间视频特征的情况下优于先前的视频描述方法。
引用
@article{arxiv.1611.02261,
title = {Memory-augmented Attention Modelling for Videos},
author = {Rasool Fakoor and Abdel-rahman Mohamed and Margaret Mitchell and Sing Bing Kang and Pushmeet Kohli},
journal= {arXiv preprint arXiv:1611.02261},
year = {2017}
}
备注
Revised version, minor changes, add the link for the source codes