下一块预测:基于半自回归建模的视频生成
计算机视觉与模式识别
2025-02-13 v2 人工智能
摘要
Next-Token Prediction (NTP) 是自回归 (AR) 视频生成的事实标准方法,但它存在单向依赖次优和推理速度慢的问题。在这项工作中,我们提出了一个用于视频生成的半自回归 (semi-AR) 框架,称为 Next-Block Prediction (NBP)。通过将视频内容均匀分解为等大小的块(例如行或帧),我们将生成单元从单个 token 转移到块,允许当前块中的每个 token 同时预测下一个块中对应的 token。与传统的 AR 建模不同,我们的框架在每个块内采用双向注意力,使 token 能够捕获更鲁棒的空间依赖关系。通过并行预测多个 token,NBP 模型显著减少了生成步数,从而实现更快、更高效的推理。我们的模型在 UCF101 上取得了 103.3 的 FVD 分数,在 K600 上取得了 25.5 的 FVD 分数,平均优于原始 NTP 模型 4.4。此外,得益于推理步数的减少,NBP 模型每秒生成 8.89 帧(128x128 分辨率),实现了 11 倍的加速。我们还探索了从 700M 到 3B 参数的模型规模,观察到生成质量的显著提升,UCF101 上的 FVD 分数从 103.3 降至 55.3,K600 上从 25.5 降至 19.5,证明了我们方法的可扩展性。
引用
@article{arxiv.2502.07737,
title = {Next Block Prediction: Video Generation via Semi-Autoregressive Modeling},
author = {Shuhuai Ren and Shuming Ma and Xu Sun and Furu Wei},
journal= {arXiv preprint arXiv:2502.07737},
year = {2025}
}
备注
project page: https://renshuhuai-andy.github.io/NBP-project/