CanvasMAR:通过画布改进基于遮盖自回归的视频预测
计算机视觉与模式识别
2026-03-09 v2 人工智能
机器学习
摘要
遮盖自回归模型 (MAR) 已成为图像和视频生成的强大范式,结合了遮盖建模的灵活性和连续标记器的表达性。然而,在逐帧采样时,视频 MAR 模型常因缺乏结构化的全局先验(尤其是仅用少量采样步骤)而产生高度失真的输出。为此,我们提出了 CanvasMAR,这是一种新的自回归视频预测模型,通过引入画布——一种对下一帧的模糊、全局一步预测——作为非均匀遮盖,用于掩码生成。画布为采样早期提供全局结构,使帧合成更快且更连贯。为进一步稳定自回归采样,我们提出了通过运动感知采样顺序实现的易到难课程,以较不动的区域先于注意高度动态区域的方式合成。我们还集成了组合无分类引导,联合强化画布和时间条件,以提高生成保真度。在 BAIR、UCF-101 和 Kinetics-600 数据集上进行的实验表明,CanvasMAR 以更少的自回归步骤产生更高质量的视频。在具有挑战性的 Kinetics-600 数据集上,CanvasMAR 在自回归模型中取得卓越成绩,并与先进的扩散方法相媳美。
引用
@article{arxiv.2510.13669,
title = {CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas},
author = {Zian Li and Muhan Zhang},
journal= {arXiv preprint arXiv:2510.13669},
year = {2026}
}