Free-Bloom: 基于 LLM 导演与 LDM 动画师的零样本文本到视频生成器
计算机视觉与模式识别
2023-09-27 v1
摘要
文本到视频是一个快速发展的研究领域,旨在生成语义一致、身份一致且时间连贯的帧序列,并与输入文本提示精确对齐。本研究考虑数据与成本高效性,聚焦于零样本文本到视频生成。为生成语义连贯的视频,展现如花朵绽放全过程而非一组“运动图像”这类丰富的时间语义刻画,我们提出了一种新颖的 Free-Bloom 流水线,其利用大语言模型(LLM)作为导演生成语义连贯的提示序列,同时利用预训练隐扩散模型(LDM)作为动画师生成高保真帧。此外,为在保持语义连贯的同时确保时间与身份连贯,我们提出了一系列注释性修改以在反向过程中适配 LDM,包括联合噪声采样、步感知注意力偏移与双路径插值。无需任何视频数据与训练要求,Free-Bloom 即可生成生动且高质量的视频,在生成具有语义有意义帧序列的复杂场景时令人惊叹。此外,Free-Bloom 天然兼容基于 LDM 的扩展。
引用
@article{arxiv.2309.14494,
title = {Free-Bloom: Zero-Shot Text-to-Video Generator with LLM Director and LDM Animator},
author = {Hanzhuo Huang and Yufan Feng and Cheng Shi and Lan Xu and Jingyi Yu and Sibei Yang},
journal= {arXiv preprint arXiv:2309.14494},
year = {2023}
}
备注
NeurIPS 2023; Project available at: https://github.com/SooLab/Free-Bloom