VideoPoet:用于零样本视频生成的语言大模型
计算机视觉与模式识别
2024-06-05 v4 人工智能
摘要
我们推出了 VideoPoet,这是一种能够从多种条件信号合成高质量视频(含匹配音频)的语言模型。VideoPoet 采用仅解码器的 Transformer 架构来处理多模态输入——包括图像、视频、文本和音频。训练协议遵循语言大模型(LLMs)的模式,包含两个阶段:预训练和任务特定适配。在预训练期间,VideoPoet 在自回归 Transformer 框架内融合了多模态生成目标的混合体。预训练的 LLM 作为基础,可适配于一系列视频生成任务。我们展示了实证结果,证明了该模型在零样本视频生成方面的 SOTA 能力,特别突出了 VideoPoet 生成高保真运动的能力。项目主页:http://sites.research.google/videopoet/
引用
@article{arxiv.2312.14125,
title = {VideoPoet: A Large Language Model for Zero-Shot Video Generation},
author = {Dan Kondratyuk and Lijun Yu and Xiuye Gu and José Lezama and Jonathan Huang and Grant Schindler and Rachel Hornung and Vighnesh Birodkar and Jimmy Yan and Ming-Chang Chiu and Krishna Somandepalli and Hassan Akbari and Yair Alon and Yong Cheng and Josh Dillon and Agrim Gupta and Meera Hahn and Anja Hauth and David Hendon and Alonso Martinez and David Minnen and Mikhail Sirotenko and Kihyuk Sohn and Xuan Yang and Hartwig Adam and Ming-Hsuan Yang and Irfan Essa and Huisheng Wang and David A. Ross and Bryan Seybold and Lu Jiang},
journal= {arXiv preprint arXiv:2312.14125},
year = {2024}
}
备注
To appear at ICML 2024; Project page: http://sites.research.google/videopoet/