FusionFrames:面向文本到视频生成流程的高效架构设计
计算机视觉与模式识别
2023-12-21 v2 机器学习
多媒体
摘要
多媒体生成方法在人工智能研究中占据重要地位。过去几年中,文本到图像模型取得了高质量的结果。然而,视频合成方法近年来才开始发展。本文提出了一种基于文本到图像扩散模型的新型两阶段隐扩散文本到视频生成架构。第一阶段关注关键帧合成以勾勒视频的故事线,而第二阶段致力于插值帧生成以使场景与物体的运动平滑。我们比较了几种用于关键帧生成的时间条件方法。结果表明,在反映视频生成质量方面和人类偏好的指标上,使用独立时间块优于时间层。我们的插值模型设计与其他掩码帧插值方法相比显著降低了计算成本。此外,我们评估了基于 MoVQ 的视频解码方案的不同配置,以改善一致性并获得更高的 PSNR、SSIM、MSE 和 LPIPS 分数。最后,我们将我们的流程与现有方案进行比较,取得了总体前两名以及开源方案中第一名的成绩:CLIPSIM = 0.2976 且 FVD = 433.054。项目页面:https://ai-forever.github.io/kandinsky-video/
引用
@article{arxiv.2311.13073,
title = {FusionFrames: Efficient Architectural Aspects for Text-to-Video Generation Pipeline},
author = {Vladimir Arkhipkin and Zein Shaheen and Viacheslav Vasilev and Elizaveta Dakhova and Andrey Kuznetsov and Denis Dimitrov},
journal= {arXiv preprint arXiv:2311.13073},
year = {2023}
}
备注
Project page: https://ai-forever.github.io/kandinsky-video/