利用自回归扩散模型加速视频逆问题求解器
计算机视觉与模式识别
2026-05-21 v1 人工智能
机器学习
摘要
扩散模型为零样本视频逆问题提供了强大的先验,但其实时部署受到两个低效因素的阻碍:整体视频修复导致的高初始延迟,以及为在像素空间强制执行测量一致性而进行的多次VAE前向传播导致的低吞吐量。为克服这些限制,我们提出了自回归视频逆问题求解器(AVIS)。AVIS框架利用自回归视频扩散模型以流式方式修复视频,自然消除了延迟瓶颈。具体而言,AVIS使用测量一致的估计初始化反向扩散,减少了所需的采样步数。与领先的非自回归求解器相比,AVIS将初始延迟从114秒大幅降低至4秒,并将吞吐量从0.71 FPS提升至1.18 FPS,同时实现了更优的修复质量。我们进一步引入了一个高度加速的变体,称为AVIS Flash,它仅对第一个块强制执行测量一致性。AVIS Flash在单个RTX 4090 GPU上将吞吐量大幅提升至5.91 FPS,同时保持有竞争力的性能并实现有利的效率-性能权衡,为实时部署铺平了道路。
引用
@article{arxiv.2605.20624,
title = {Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models},
author = {Taesung Kwon and Jonghyun Park and Hyungjin Chung and Jong Chul Ye},
journal= {arXiv preprint arXiv:2605.20624},
year = {2026}
}
备注
Project page is available here: https://avis-project.github.io/