BAgger:反向聚合以缓解自回归视频扩散模型中的漂移
计算机视觉与模式识别
2025-12-16 v1 机器学习
摘要
自回归视频模型通过下一帧预测进行世界建模前景广阔,但它们遭受暴露偏差:训练时使用干净上下文而推理时使用自生成帧,导致误差累积且质量随时间漂移。我们提出反向聚合 (BAgger),一种自监督方案,利用模型自身的 rollout 构建校正轨迹,教会模型从错误中恢复。与先前依赖少步蒸馏和分布匹配损失的方法不同——这些方法可能损害质量与多样性——BAgger 使用标准的得分匹配或流匹配目标进行训练,避免使用大型教师模型和长时间链反向传播。我们将 BAgger 应用于因果扩散 Transformer,并在文本到视频、视频扩展和多提示生成上评估,观察到更长时序的运动更稳定、视觉一致性更好且漂移减少。
引用
@article{arxiv.2512.12080,
title = {BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models},
author = {Ryan Po and Eric Ryan Chan and Changan Chen and Gordon Wetzstein},
journal= {arXiv preprint arXiv:2512.12080},
year = {2025}
}
备注
Project page here: https://ryanpo.com/bagger