CogVideo:基于 Transformer 的大规模文本到视频生成预训练
计算机视觉与模式识别
2022-06-01 v1 计算与语言
机器学习
摘要
大规模预训练 Transformer 已在文本(GPT-3)和文本到图像(DALL-E 和 CogView)生成中创造了里程碑。其在视频生成中的应用仍面临诸多挑战:潜在的巨大计算成本使从头训练难以负担;文本-视频数据集的稀缺性与弱相关性阻碍了模型理解复杂运动语义。在本工作中,我们提出了 90 亿参数的 Transformer 模型 CogVideo,通过继承预训练的文本到图像模型 CogView2 进行训练。我们还提出了多帧率分层训练策略,以更好地对齐文本与视频片段。作为(可能是)首个开源的大规模预训练文本到视频模型,CogVideo 在机器与人类评估中以大幅优势优于所有公开可用模型。
引用
@article{arxiv.2205.15868,
title = {CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers},
author = {Wenyi Hong and Ming Ding and Wendi Zheng and Xinghan Liu and Jie Tang},
journal= {arXiv preprint arXiv:2205.15868},
year = {2022}
}