DeepStory:基于深度嵌入记忆网络的视频故事问答
计算机视觉与模式识别
2017-07-05 v1 人工智能
计算与语言
摘要
基于视频内容的问答(QA)是实现人类水平智能的重大挑战,因为它涉及现实场景中的视觉与语言。本文展示了 AI 智能体通过从大量卡通视频中学习来执行视频故事问答的可能性。我们开发了视频故事学习模型,即深度嵌入记忆网络(Deep Embedded Memory Networks, DEMN),利用观测数据的潜在嵌入空间从场景-对话联合视频流中重建故事。视频故事存储在长期记忆组件中。对于给定的问题,基于 LSTM 的注意力模型利用长期记忆,通过关注包含关键信息的具体单词来回忆最佳的问题-故事-答案三元组。我们在儿童卡通视频系列 Pororo 的新问答数据集上训练了 DEMN。该数据集包含 20.5 小时视频的 16,066 个场景-对话对、27,328 句用于场景描述的细粒度句子,以及 8,913 个故事相关问答对。实验结果表明 DEMN 优于其他 QA 模型。这主要归因于:1)利用潜在嵌入以场景-对话结合形式重建视频故事;2)注意力机制。DEMN 在 MovieQA 基准上也取得了最先进的成果。
引用
@article{arxiv.1707.00836,
title = {DeepStory: Video Story QA by Deep Embedded Memory Networks},
author = {Kyung-Min Kim and Min-Oh Heo and Seong-Ho Choi and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:1707.00836},
year = {2017}
}
备注
7 pages, accepted for IJCAI 2017