中文

REGen:面向长视频到短视频编辑的多模态检索嵌入生成

计算机视觉与模式识别 2025-05-27 v1 人工智能

摘要

短视频是提高内容传播和知识可及性的有效工具。虽然现有的抽取式视频摘要方法难以产生连贯的叙事,但现有的抽象方法无法“引用”输入视频中的片段,即在输出中插入短视频剪辑。在本工作中,我们探索了用于生成具有连贯叙事且嵌入来自长输入视频中抽取视频剪辑的短视频的新型视频编辑模型。我们提出了一种检索嵌入生成框架,允许大型语言模型在保持连贯叙事的同时引用多模态资源。我们提出的 REGen 系统首先使用微调后的大型语言模型生成带有引用占位符的输出故事脚本,然后使用新颖的检索模型将引用占位符替换为从候选可引用视频剪辑池中选取的最佳支持叙事的视频剪辑。我们在文档 teaser 生成任务上 examination 了所提方法,该任务中常见短访谈插入用于支持文档的叙事。我们的客观评估显示,所提方法能够有效插入短视频剪辑,同时保持叙事连贯。在主观调查中,我们表明所提方法在 teaser 生成的连贯性、对齐性和真实性方面,优于现有的抽象方法和抽取方法。

关键词

引用

@article{arxiv.2505.18880,
  title  = {REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing},
  author = {Weihan Xu and Yimeng Ma and Jingyue Huang and Yang Li and Wenye Ma and Taylor Berg-Kirkpatrick and Julian McAuley and Paul Pu Liang and Hao-Wen Dong},
  journal= {arXiv preprint arXiv:2505.18880},
  year   = {2025}
}