中文

电影叙事的多语言概要:面向视觉-语言故事理解的数据集

计算与语言 2024-10-04 v2

摘要

故事视频-文本对齐是计算故事理解中的核心任务,旨在将视频剪辑与其描述中的相应句子对齐。然而,该任务的进展受到以下两个方面的制约:首先,稀缺的手动标注视频-文本对应关系;其次,对好莱坞电影英文叙述的关注过于集中。为此,本文构建了一个大型多语言视频故事数据集,命名为 Multilingual Synopses of Movie Narratives (M-SYMON),包含来自 7 种语言的 13,166 部电影概要视频,以及对 101.5 小时视频的粗粒度视频-文本对应关系的手动标注。我们在 SyMoN 上获得的人工标注数据训练的模型在 Clip Accuracy 和句子 IoU 分数上分别超过 SOTA 方法 15.7 和 16.2 个百分点,证明了标注的有效性。作为面向未来研究的基准,我们创建了 6 种不同的多语言训练策略的基线方法,比较了它们在同一语言和跨语言设置下的性能,凸显了多语言视频-文本对齐的挑战。该数据集已发布于:https://github.com/insundaycathy/M-SyMoN

关键词

引用

@article{arxiv.2406.13092,
  title  = {Multilingual Synopses of Movie Narratives: A Dataset for Vision-Language Story Understanding},
  author = {Yidan Sun and Jianfei Yu and Boyang Li},
  journal= {arXiv preprint arXiv:2406.13092},
  year   = {2024}
}

备注

17 pages, 8 figures