中文

ChopGrad:基于截断反向传播的隐式视频扩散像素级损失

计算机视觉与模式识别 2026-04-09 v2 人工智能 机器学习

摘要

最近的视频扩散模型通过循环帧处理实现高质量生成,其中每帧的生成依赖于前一帧。然而,这种循环机制意味着在像素域训练此类模型会产生高昂的内存开销,因为激活在整个视频序列上累积。该根本性限制还使得使用像素级损失对长视频或高分辨率视频进行微调在计算上几乎不可能。本文引入ChopGrad,一种用于视频解码的截断反向传播方案,将梯度计算限制在局部帧窗口内,同时保持全局一致性。我们对该近似方法进行理论分析,表明其可高效实现基于帧的损失微调。ChopGrad将训练内存从全反向传播时视频帧数的线性增长降低到恒定内存,并在一系列以像素级损失进行的条件视频生成任务中表现优于现有最先进技术,包括视频超分辨、视频图像填充、神经渲染场景视频增强以及受控驾驶视频生成。

关键词

引用

@article{arxiv.2603.17812,
  title  = {ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation},
  author = {Dmitriy Rivkin and Parker Ewen and Lili Gao and Julian Ost and Stefanie Walz and Rasika Kangutkar and Mario Bijelic and Felix Heide},
  journal= {arXiv preprint arXiv:2603.17812},
  year   = {2026}
}

备注

Project website: https://light.princeton.edu/chopgrad