中文

电影叙事梗概:一个用于故事理解的图像-语言数据集

计算机视觉与模式识别 2023-04-06 v4 计算与语言 机器学习

摘要

尽管人工智能近期取得进展,故事理解仍是一个开放且研究不足的问题。我们收集、预处理并公开发布了一个图像-语言故事数据集——电影叙事梗概(Synopses of Movie Narratives, SyMoN),包含 5,193 个流行电影与电视剧的视频摘要,总时长 869 小时。SyMoN 收录了由人类创作者制作、面向人类观众的自然主义叙事视频。作为一个原型性且自然主义的叙事数据集,SyMoN 具有对多模态故事事件的高覆盖度以及丰富的心理状态描述。其对叙事技巧的运用造成了跨域语义鸿沟,为现有模型提供了恰当的挑战。我们在视频-文本检索与电影摘要视频上的零样本对齐任务上建立了基准,展示了领域内数据与长期记忆在故事理解中的重要性。我们希望借助 SyMoN 为多模态故事理解的进展奠定基础。

关键词

引用

@article{arxiv.2203.05711,
  title  = {Synopses of Movie Narratives: a Video-Language Dataset for Story Understanding},
  author = {Yidan Sun and Qin Chao and Yangfeng Ji and Boyang Li},
  journal= {arXiv preprint arXiv:2203.05711},
  year   = {2023}
}

备注

25 pages, 17 figures