SEINE:面向生成式转场与预测的长短视频扩散模型
计算机视觉与模式识别
2023-11-07 v2
摘要
近年来视频生成已取得实质性进展,生成结果愈发逼真。然而,现有AI生成视频通常是非常短的片段(“镜头级”),仅描绘单一场景。为呈现连贯的长视频(“故事级”),不同片段之间需要具备创造性的转场与预测效果。本文提出一种短视频到长视频的扩散模型SEINE,专注于生成式转场与预测。其目标是生成高质量长视频,在场景间实现平滑且富有创意的转场,并支持不同长度的镜头级视频。具体而言,我们提出一种随机掩码视频扩散模型,可基于文本描述自动生成转场。通过输入不同场景的图像,并结合基于文本的控制,我们的模型生成的转场视频保证了连贯性与视觉质量。此外,该模型可便捷地扩展至图像到视频动画、自回归视频预测等多种任务。为对这一新生成任务进行全面评估,我们提出三项用于平滑且创意转场的评判标准:时间一致性、语义相似度以及视频-文本语义对齐。大量实验验证了我们的方法在生成式转场与预测上优于现有方法,能够创作故事级长视频。项目页面:https://vchitect.github.io/SEINE-project/ 。
引用
@article{arxiv.2310.20700,
title = {SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction},
author = {Xinyuan Chen and Yaohui Wang and Lingjun Zhang and Shaobin Zhuang and Xin Ma and Jiashuo Yu and Yali Wang and Dahua Lin and Yu Qiao and Ziwei Liu},
journal= {arXiv preprint arXiv:2310.20700},
year = {2023}
}
备注
Project page: https://vchitect.github.io/SEINE-project/