中文

ShotAdapter:基于扩散模型的文本到多镜头视频生成

计算机视觉与模式识别 2025-05-13 v1

摘要

当前基于扩散的文本到视频方法局限于生成单镜头短视频,缺乏生成带有离散转换、且同一角色在相同或不同背景下完成不同活动的多镜头视频的能力。为此,我们提出一个框架,包括数据集收集管道和对视频扩散模型的架构扩展,以实现文本到多镜头视频的生成。我们的方法能够以单一视频形式生成多镜头视频,所有帧之间实现全局注意力,确保人物和背景的一致性,并允许用户通过镜头特定条件控制镜头数量、时长和内容。通过在文本到视频模型中引入转换标记来控制新镜头起始的帧,结合局部注意力掩码策略来控制转换标记的影响并实现镜头特定的提示。为获取训练数据,我们提出了新颖的数据收集管道,从现有单镜头视频数据集构建多镜头视频数据集。大量实验表明,仅需数千次迭代对预训练文本到视频模型进行微调,即可使模型能够生成具有镜头特定控制的多镜头视频,超越基线方法。详情请参阅 https://shotadapter.github.io/

关键词

引用

@article{arxiv.2505.07652,
  title  = {ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models},
  author = {Ozgur Kara and Krishna Kumar Singh and Feng Liu and Duygu Ceylan and James M. Rehg and Tobias Hinz},
  journal= {arXiv preprint arXiv:2505.07652},
  year   = {2025}
}

备注

CVPR 2025