Goku:基于流变的视频生成式基础模型
计算机视觉与模式识别
2025-02-11 v2
摘要
本文介绍 Goku,一套基于流变 Transformer 的联合图像-视频生成模型,实现行业领先的性能。我们详细阐述了实现高质量视觉生成的基础要素,包括数据 curated 流水线、模型架构设计、流形式化以及高效稳健的大规模训练基础设施。Goku 模型在定性和定量评估中均表现卓越,跨越主要任务均取得了新的基准。具体而言,Goku 在文本到图像生成任务中达到 0.76 的 GenEval 分数和 83.65 的 DPG-Bench 分数,并在文本到视频任务中取得 84.85 的 VBench 分数。我们相信,这项工作为研究社区在开发联合图像-视频生成模型方面提供了宝贵的见解和实际进展。
关键词
引用
@article{arxiv.2502.04896,
title = {Goku: Flow Based Video Generative Foundation Models},
author = {Shoufa Chen and Chongjian Ge and Yuqi Zhang and Yida Zhang and Fengda Zhu and Hao Yang and Hongxiang Hao and Hui Wu and Zhichao Lai and Yifei Hu and Ting-Che Lin and Shilong Zhang and Fu Li and Chuan Li and Xing Wang and Yanghua Peng and Peize Sun and Ping Luo and Yi Jiang and Zehuan Yuan and Bingyue Peng and Xiaobing Liu},
journal= {arXiv preprint arXiv:2502.04896},
year = {2025}
}
备注
Demo: https://saiyan-world.github.io/goku/