中文

面向长时视频生成的多句子视频定位

计算机视觉与模式识别 2024-07-19 v1

摘要

视频生成近期取得了很大成功,但在生成长时视频方面的应用仍面临维持生成视频时间一致性难以及生成过程高内存成本的挑战。为此,本文提出了一种全新的思路——面向长时视频生成的多句子视频定位,将大规模视频时段检索与视频生成任务首次连接起来,为长时视频生成提供了新的范式。本文方法可概括为三个步骤:(i) 我们设计作为视频定位查询的序列场景文本提示,利用大规模视频时段检索在视频数据库中搜索满足文本要求的视频时段。(ii) 基于检索到的视频时段的源帧,我们采用视频编辑方法在保持检索视频时间一致性的前提下创建新的视频内容。由于编辑可按段甚至按帧进行,大幅降低了内存成本。(iii) 我们还尝试视频形变和个性化生成方法以提高长时视频生成的主体一致性,为长时视频生成的各子任务提供了消融实验结果。我们的做法无缝地将图像/视频编辑、视频形变、个性化生成和视频定位等发展延伸至长时视频生成,为低内存成本下生成长时视频提供了有效解决方案。

关键词

引用

@article{arxiv.2407.13219,
  title  = {Multi-sentence Video Grounding for Long Video Generation},
  author = {Wei Feng and Xin Wang and Hong Chen and Zeyang Zhang and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2407.13219},
  year   = {2024}
}