中文

基于文本-视频多粒度集成的视频时刻蒙太奇

计算机视觉与模式识别 2024-12-13 v1

摘要

在线短视频平台的快速发展推动了用户对短视频编辑的需求日益增长。然而,手动选择、裁剪和组装原始影片以创建与预提供叙述文本一致的连贯高质量视频仍然繁琐且耗时。为加快这一过程,我们关注一种新的用户友好任务——视频时刻蒙太奇 (VMM),旨在根据预提供的叙述文本准确定位相应的视频片段,然后将这些视频剪辑排列以创建与相应描述一致的完整视频。挑战在于在确保段内和段间上下文一致性方面提取精确的时间段,因为单个脚本句子可能需要裁剪和组装多个视频剪辑。为解决此问题,我们提出了一种新颖的方法——文本-视频多粒度集成 (TV-MGI),该方法有效地将脚本中的文本特征与视频的 shot 级别和 frame 级别特征融合,使视频内容与相应文本描述之间实现了全局和细粒度的对齐。为促进该领域的进一步研究,我们引入了多个带有 shot 数据集 (MSSD),该数据集是专为 VMM 任务设计的大型数据集。我们在 MSSD 数据集上进行了大量实验,证明了该框架相对于基线方法的有效性。

关键词

引用

@article{arxiv.2412.09276,
  title  = {Text-Video Multi-Grained Integration for Video Moment Montage},
  author = {Zhihui Yin and Ye Ma and Xipeng Cao and Bo Wang and Quan Chen and Peng Jiang},
  journal= {arXiv preprint arXiv:2412.09276},
  year   = {2024}
}