中文

利用扩散模型的无自回归视频预测以缓解误差传播

计算机视觉与模式识别 2025-06-02 v2

摘要

现有的长期视频预测方法通常依赖于自回归视频预测机制。然而,这种方法存在误差传播问题,尤其是在遥远的未来帧中。为了解决这一局限性,本文提出了首个使用扩散模型的无自回归视频预测框架。与自回归视频预测机制不同,ARFree 直接从上下文帧元组预测任意未来帧元组。所提出的 ARFree 由两个关键组件组成:1)一个运动预测模块,利用从上下文帧元组中提取的运动特征来预测未来运动;2)一种训练方法,用于改善相邻未来帧元组之间的运动连续性和上下文一致性。我们在两个基准数据集上的实验表明,所提出的 ARFree 视频预测框架优于几种最先进的视频预测方法。

关键词

引用

@article{arxiv.2505.22111,
  title  = {Autoregression-free video prediction using diffusion model for mitigating error propagation},
  author = {Woonho Ko and Jin Bok Park and Il Yong Chun},
  journal= {arXiv preprint arXiv:2505.22111},
  year   = {2025}
}

备注

6 pages, 4 figures, 2 tables