中文

从下一帧预测中学习:自回归视频建模编码有效表征

计算机视觉与模式识别 2025-12-25 v1

摘要

预训练通用基础模型的最新进展显著提升了各类下游任务的性能。尽管像 GPT 这样的自回归(AR)生成模型已彻底改变了自然语言处理领域,但大多数视觉生成预训练方法仍依赖于 BERT 风格的掩码建模,这通常忽略了视频分析所必需的时间信息。少数现有的自回归视觉预训练方法存在语义定位不准和生成质量差等问题,导致语义表征不佳。在本工作中,我们提出 NExT-Vid,一种新颖的自回归视觉生成预训练框架,利用掩码下一帧预测来联合建模图像和视频。NExT-Vid 引入了一个上下文隔离的自回归预测器,将语义表征与目标解码解耦,并采用条件流匹配解码器来提升生成质量和多样性。通过上下文隔离的流匹配预训练,我们的方法获得了强大的表征能力。在大规模预训练模型上的大量实验表明,我们提出的方法在下游分类任务中,通过注意力探测进行视觉表征学习,其性能持续优于以往的生成预训练方法。

关键词

引用

@article{arxiv.2512.21004,
  title  = {Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations},
  author = {Jinghan Li and Yang Jin and Hao Jiang and Yadong Mu and Yang Song and Kun Xu},
  journal= {arXiv preprint arXiv:2512.21004},
  year   = {2025}
}