动画贴纸:利用视频扩散让贴纸动起来
计算机视觉与模式识别
2024-02-12 v1
摘要
我们引入了动画贴纸,这是一种以文本提示和静态贴纸图像为条件生成动画的视频扩散模型。我们的模型建立在最先进的 Emu 文本到图像模型之上,并添加了时间层以对运动进行建模。由于领域差距,即视觉和运动风格上的差异,在生成自然视频上表现良好的模型在应用于贴纸时无法生成生动的视频。为了弥合这一差距,我们采用了两阶段微调流水线:首先使用弱领域内数据,随后采用我们称之为集成教师的人类在环(HITL)策略。该策略将多个教师的最佳质量蒸馏到一个更小的学生模型中。我们表明,该策略使我们能够专门针对运动质量进行改进,同时保持静态图像的风格。通过推理优化,我们的模型能够在不到一秒的时间内生成具有高质量、有趣且相关运动的八帧视频。
引用
@article{arxiv.2402.06088,
title = {Animated Stickers: Bringing Stickers to Life with Video Diffusion},
author = {David Yan and Winnie Zhang and Luxin Zhang and Anmol Kalia and Dingkang Wang and Ankit Ramchandani and Miao Liu and Albert Pumarola and Edgar Schoenfeld and Elliot Blanchard and Krishna Narni and Yaqiao Luo and Lawrence Chen and Guan Pang and Ali Thabet and Peter Vajda and Amy Bearman and Licheng Yu},
journal= {arXiv preprint arXiv:2402.06088},
year = {2024}
}