中文

细粒度零样本视频采样

计算机视觉与模式识别 2024-08-01 v1 人工智能

摘要

将时间维度融入预训练图像扩散模型以进行视频生成是一种常见方法。然而,该方法计算代价高昂,且需要大规模视频数据集。更关键的是,图像数据集与视频数据集之间的异构性往往导致图像专业知识的灾难性遗忘。近期直接利用图像扩散模型提取视频片段的尝试在一定程度上缓解了这些问题。然而,这些方法只能生成具有简单运动的短视频片段,无法捕捉细粒度运动或非网格形变。在本文中,我们提出了一种新颖的零样本视频采样算法 ZS2\mathcal{ZS}^2,能够直接从现有的图像合成方法(如 Stable Diffusion)中采样高质量视频片段,无需任何训练或优化。具体而言,ZS2\mathcal{ZS}^2 利用依赖噪声模型和时间动量注意力分别确保内容一致性和动画连贯性。这种能力使其在相关任务(如条件视频生成和上下文特化视频生成以及指令引导视频编辑)中表现出色。实验结果表明,ZS2\mathcal{ZS}^2 在零样本视频生成中达到了最先进的性能,偶尔甚至优于近期的监督方法。主页: \url{https://densechen.github.io/zss/}.

关键词

引用

@article{arxiv.2407.21475,
  title  = {Fine-gained Zero-shot Video Sampling},
  author = {Dengsheng Chen and Jie Hu and Xiaoming Wei and Enhua Wu},
  journal= {arXiv preprint arXiv:2407.21475},
  year   = {2024}
}