视频讲故事:面向事件的文本摘要
多媒体
2020-05-15 v3 计算机视觉与模式识别
摘要
连接视觉与自然语言是计算机视觉与多媒体研究中长期的目标。早期工作聚焦于为视觉内容生成单句描述,近期工作则研究了段落生成。本工作中,我们引入视频讲故事问题,旨在为长视频生成连贯且简洁的故事。视频讲故事带来了新的挑战,主要源于故事的多样性以及视频的长度与复杂性。我们提出新颖方法来应对这些挑战。首先,我们提出一个用于多模态嵌入学习的上下文感知框架,其中设计了残差双向循环神经网络以利用来自过去和未来的上下文信息。其次,我们提出一个叙述者(Narrator)模型来发现潜在的故事线。该叙述者被构建为一个强化学习智能体,通过直接优化所生成故事的文本度量进行训练。我们在 Video Story 数据集上评估了我们的方法,该数据集为我们为支持该研究而收集的新数据集。我们将我们的方法与多个最先进的基线进行比较,并表明我们的方法在量化指标和用户研究中均取得更好性能。
引用
@article{arxiv.1807.09418,
title = {Video Storytelling: Textual Summaries for Events},
author = {Junnan Li and Yongkang Wong and Qi Zhao and Mohan S. Kankanhalli},
journal= {arXiv preprint arXiv:1807.09418},
year = {2020}
}
备注
Published in IEEE Transactions on Multimedia