中文

VideoXum:视频的跨模态视觉与文本摘要

计算机视觉与模式识别 2024-04-24 v3 计算与语言

摘要

视频摘要旨在从源视频中提取最重要的信息以生成删节片段或文本叙述。传统上,根据输出是视频还是文本提出了不同方法,从而忽略了视觉摘要和文本摘要这两个语义相关任务之间的关联。我们提出一项新的联合视频与文本摘要任务。目标是从长视频中生成缩短的视频片段及相应的文本摘要,统称为跨模态摘要。生成的缩短视频片段和文本叙述应在语义上良好对齐。为此,我们首先构建了一个大规模人工标注数据集——VideoXum(X指不同模态)。该数据集基于ActivityNet重新标注。在筛选出不符合长度要求的视频后,我们的新数据集中剩余14,001个长视频。我们重新标注的数据集中每个视频都有人工标注的视频摘要和相应的叙述摘要。然后我们设计了一个新颖的端到端模型——VTSUM-BILP来解决我们所提出任务的挑战。此外,我们提出了一个称为VT-CLIPScore的新指标来帮助评估跨模态摘要的语义一致性。所提出的模型在这一新任务上取得了有前景的性能,并为未来研究建立了基准。

关键词

引用

@article{arxiv.2303.12060,
  title  = {VideoXum: Cross-modal Visual and Textural Summarization of Videos},
  author = {Jingyang Lin and Hang Hua and Ming Chen and Yikang Li and Jenhao Hsiao and Chiuman Ho and Jiebo Luo},
  journal= {arXiv preprint arXiv:2303.12060},
  year   = {2024}
}

备注

13 pages, 7 figures