中文

LoopAnimate: 可循环的显著对象动画生成

计算机视觉与模式识别 2024-04-17 v2 人工智能

摘要

基于扩散模型的视频生成研究进展迅速。然而,对象保真度和生成长度方面的限制阻碍了其实际应用。此外,像动态壁纸这样的特定领域需要无缝循环,即视频的第一帧和最后一帧无缝匹配。为了应对这些挑战,本文提出了LoopAnimate,一种生成具有一致首尾帧视频的新方法。为了增强对象保真度,我们引入了一个解耦多级图像外观和文本语义信息的框架。基于图像到图像的扩散模型,我们的方法结合了输入图像的像素级和特征级信息,在扩散模型的不同位置注入图像外观和文本语义嵌入。现有的基于UNet的视频生成模型需要在训练时输入整个视频以一次性编码时间和位置信息。然而,由于GPU内存的限制,帧数通常被限制在16帧。为了解决这个问题,本文提出了一种三阶段训练策略,逐步增加帧数并减少微调模块。此外,我们引入了时间增强运动模块(TEMM),将编码时间和位置信息的能力扩展到最多36帧。所提出的LoopAnimate首次将基于UNet的视频生成模型的单次生成长度扩展到35帧,同时保持高质量的视频生成。实验表明,LoopAnimate在保真度和时间一致性等客观指标以及主观评估结果方面均达到了最先进的性能。

关键词

引用

@article{arxiv.2404.09172,
  title  = {LoopAnimate: Loopable Salient Object Animation},
  author = {Fanyi Wang and Peng Liu and Haotian Hu and Dan Meng and Jingwen Su and Jinjin Xu and Yanhao Zhang and Xiaoming Ren and Zhiwang Zhang},
  journal= {arXiv preprint arXiv:2404.09172},
  year   = {2024}
}