面向电视剧和情节概述的多段落视频定位大规模数据集 SynopGround
计算机视觉与模式识别
2024-08-20 v4 多媒体
摘要
视频定位是多模态内容理解中的一个基本问题,旨在在未剪辑的视频中定位特定的自然语言查询。然而,当前的视频定位数据集仅关注简单事件,要么局限于较短的视频,要么局限于简短的句子,这阻碍了模型向更强的多模态理解能力发展。为此,我们提出了一个大规模视频定位数据集,命名为 SynopGround,其中来自流行电视剧的超过 2800 小时的视频与准确定位的人工撰写情节概述配对。情节概述中的每个段落作为语言查询,手动标注了在长视频中的精确时间边界。这些段落查询彼此紧密相关,包含大量概括视频叙事的抽象表达,以及刻画事件细节的具体描述,这使得模型能够在更复杂的概念上学习多模态感知,并处理更长的上下文依赖。基于该数据集,我们进一步提出了更复杂的视频定位设定,称为多段落视频定位 (MPVG),该设定将多个段落和长视频作为输入,将每个段落查询定位到其时间区间。此外,我们提出了一种新型的局部-全局多模态推理器 (LGMR),用于显式建模长期多模态输入的局部-全局结构,以解决 MPVG。我们的方法为多段落视频定位问题提供了有效的基线解决方案。大量实验验证了所提模型的有效性以及其在长期多段落视频定位方面相对于先前最先进技术的优势。数据集和代码均已公开。项目页面: https://synopground.github.io/。
引用
@article{arxiv.2408.01669,
title = {SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses},
author = {Chaolei Tan and Zihang Lin and Junfu Pu and Zhongang Qi and Wei-Yi Pei and Zhi Qu and Yexin Wang and Ying Shan and Wei-Shi Zheng and Jian-Fang Hu},
journal= {arXiv preprint arXiv:2408.01669},
year = {2024}
}
备注
Accepted to ACM MM 2024. Project page: https://synopground.github.io/