中文

基于Next Clip扩散的Video-GPT

计算机视觉与模式识别 2025-05-22 v2 人工智能

摘要

GPT 在自然语言处理方面展现了卓越的成功,但语言序列不足以描述视觉世界中的空间时间细节。相反,视频序列在捕捉此类细节方面更为出色。本文提出一种以视频为新语言进行视觉世界建模的简洁Video-GPT。类比GPT中的下一个token预测,我们引入一种新的next clip扩散范式用于预训练Video-GPT。与前述工作不同,Video-GPT能够同时处理短期生成和长期预测,通过自回归方式对噪声clip进行去噪,其依据为历史中干净的clip。大量实验表明,Video-GPT在视频预测任务上实现了最新的性能表现,这是实现世界建模(Physics-IQ基准测试:Video-GPT 34.97 vs. Kling 23.64 vs. Wan 20.89)的关键因素。此外,它在6项主流视频任务上的生成和理解方面均能良好适配,显示出在下游任务中的广泛泛化能力。项目页面位于 https://zhuangshaobin.github.io/Video-GPT.github.io/。

关键词

引用

@article{arxiv.2505.12489,
  title  = {Video-GPT via Next Clip Diffusion},
  author = {Shaobin Zhuang and Zhipeng Huang and Ying Zhang and Fangyikang Wang and Canmiao Fu and Binxin Yang and Chong Sun and Chen Li and Yali Wang},
  journal= {arXiv preprint arXiv:2505.12489},
  year   = {2025}
}

备注

22 pages, 12 figures, 18 tables