HARIVO:面向视频生成的文本到图像模型方法
计算机视觉与模式识别
2024-10-11 v1 人工智能
摘要
我们提出了一种从预训练文本到图像(T2I)模型创建基于扩散的视频模型的方法。最近,AnimateDiff 提出冻结 T2I 模型仅训练时间层。我们通过提出独特的架构、纳入映射网络和帧级标记,为视频生成量身定制,同时保持原始 T2I 模型的多样性和创造力。关键创新包括用于时间平滑性的新损失函数以及缓解梯度抽样技术,确保在有限公开视频数据下生成逼真且在时间上一致的视频。我们成功地将视频特定的归纳偏置整合到架构和损失函数中。我们的方法基于冻结的 StableDiffusion 模型构建,简化了训练过程,并允许与 ControlNet 和 DreamBooth 等即插即用模型无缝集成。项目页面:https://kwonminki.github.io/HARIVO
引用
@article{arxiv.2410.07763,
title = {HARIVO: Harnessing Text-to-Image Models for Video Generation},
author = {Mingi Kwon and Seoung Wug Oh and Yang Zhou and Difan Liu and Joon-Young Lee and Haoran Cai and Baqiao Liu and Feng Liu and Youngjung Uh},
journal= {arXiv preprint arXiv:2410.07763},
year = {2024}
}
备注
ECCV2024