中文

面向脚本驱动的多模态视频摘要方法与数据集

计算机视觉与模式识别 2026-05-08 v2

摘要

本文提出一种方法和两个大规模数据集,用于脚本驱动的多模态视频摘要。该方法称为SD-MVSum,基于我们先前的SD-VSum方法,该方法仅考虑视频的视觉内容。SD-MVSum除考虑视觉模态外,还考虑用户提供的脚本与视频中口述内容(即音频转录)的相关性。该方法通过一种新的加权跨模态注意力机制来建模每一对数据模态(即脚本-视频和脚本-转录)之间的依赖关系。该机制显式地利用配对模态之间的语义相似性,以促进与用户提供脚本相关性最高的视频片段。此外,我们扩展了两个大规模数据集(脚本驱动数据集S-VideoXum和通用数据集MrHiSum),以适用于脚本驱动的多模态视频摘要方法的训练和评估。实验比较记录了所提出SD-MVSum方法在脚本驱动和通用视频摘要方面与其他SOTA方法的竞争性。我们新的方法和扩展后的数据集可在https://github.com/IDT-ITI/SD-MVSum访问。

关键词

引用

@article{arxiv.2510.05652,
  title  = {SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets},
  author = {Manolis Mylonas and Charalampia Zerva and Evlampios Apostolidis and Vasileios Mezaris},
  journal= {arXiv preprint arXiv:2510.05652},
  year   = {2026}
}

备注

Under review