中文

MAVIN: 基于扩散模型通过过渡视频填充的多动作视频生成

计算机视觉与模式识别 2024-05-29 v1 人工智能

摘要

基于扩散的视频生成已取得显著进展,但生成顺序发生的多个动作仍然是一项艰巨的任务。由于缺乏细粒度的动作标注,以及难以建立时间语义对应关系和保持长期一致性,直接生成包含顺序动作的视频极具挑战性。为解决此问题,我们提出一种直观且直接的解决方案:顺序拼接多个单动作视频片段。核心挑战在于,考虑到动作转换固有的复杂性和多变性,如何在这些片段之间生成平滑自然的过渡。我们引入了MAVIN(多动作视频填充模型),旨在生成能够无缝连接两个给定视频的过渡视频,从而形成一个连贯的集成序列。MAVIN融合了多项创新技术来应对过渡视频填充任务中的挑战。首先,采用连续加噪策略结合可变长度采样来处理大的填充间隙和变化的生成长度。其次,提出了边界帧引导(BFG)来解决过渡生成过程中缺乏语义引导的问题。最后,高斯滤波器混合器(GFM)在推理过程中动态管理噪声初始化,在保持生成灵活性的同时缓解训练-测试差异。此外,我们引入了一个新指标CLIP-RS(CLIP相对平滑度)来评估时间连贯性和平滑度,以补充传统的基于质量的指标。在马和老虎场景上的实验结果表明,与现有方法相比,MAVIN在生成平滑连贯的视频过渡方面具有优越性能。

关键词

引用

@article{arxiv.2405.18003,
  title  = {MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling},
  author = {Bowen Zhang and Xiaofei Xie and Haotian Lu and Na Ma and Tianlin Li and Qing Guo},
  journal= {arXiv preprint arXiv:2405.18003},
  year   = {2024}
}