电影问答:为分层视觉内容记忆文本线索
计算机视觉与模式识别
2018-04-26 v1
摘要
电影为我们提供了大量视觉内容以及引人入胜的故事。已有方法表明,仅通过视觉内容理解电影故事仍是一个难题。在本文中,针对电影问答任务,我们提出了一种分层记忆网络(LMN),分别通过静态词语记忆模块和动态字幕记忆模块来表示帧级和片段级的电影内容。具体而言,我们首先从训练电影字幕中提取词语和句子。然后,从 LMN 学习到的分层电影表示不仅编码了帧内词语与视觉内容之间的对应关系,还编码了电影片段内句子与帧之间的时间对齐关系。我们还将 LMN 模型扩展为三种变体框架,以展示其良好的可扩展能力。我们在 MovieQA 数据集上进行了大量实验。仅以视觉内容作为输入时,具有帧级表示的 LMN 取得了大幅性能提升。当将字幕纳入 LMN 以形成片段级表示时,我们在“视频+字幕”的在线评测任务上达到了最先进的性能。良好的性能成功证明了所提出的 LMN 框架是有效的,且分层形成的电影表示在电影问答应用方面具有良好的潜力。
引用
@article{arxiv.1804.09412,
title = {Movie Question Answering: Remembering the Textual Cues for Layered Visual Contents},
author = {Bo Wang and Youjiang Xu and Yahong Han and Richang Hong},
journal= {arXiv preprint arXiv:1804.09412},
year = {2018}
}
备注
Accepted by AAAI2018