FlexiFilm:基于灵活条件的长视频生成
计算机视觉与模式识别
2024-04-30 v1
摘要
生成长且一致的视频已成为一个重要且具挑战性的问题。尽管大多数基于扩散模型并衍生自图像生成模型的视频生成模型在生成短视频方面表现出可期的性能,但其最初为图像生成设计的简单条件机制和采样策略在适配于长视频生成时会导致严重的性能退化。这会导致显著的时间不一致性和过曝问题。因此,在这项工作中,我们引入了 FlexiFilm,一个专为长视频生成量身定制的新型扩散模型。我们的框架包含一个时间条件器以在生成与多模态条件之间建立更一致的关系,以及一个重采样策略以解决过曝问题。实验结果表明,FlexiFilm 能够生成长且一致的视频,每个视频长度超过 30 秒,在定性和定量分析中均优于竞争方法。项目页面:https://y-ichen.github.io/FlexiFilm-Page/
引用
@article{arxiv.2404.18620,
title = {FlexiFilm: Long Video Generation with Flexible Conditions},
author = {Yichen Ouyang and jianhao Yuan and Hao Zhao and Gaoang Wang and Bo zhao},
journal= {arXiv preprint arXiv:2404.18620},
year = {2024}
}
备注
9 pages, 9 figures