AutoRefiner:通过随机采样路径上的反射式精化提升自回归视频扩散模型
计算机视觉与模式识别
2025-12-16 v2
摘要
自回归视频扩散模型(AR-VDM)作为双向VDM的可扩展替代方案展现出巨大潜力,可实现实时与交互式应用。然而其样本保真度仍有提升空间。一种有前景的解决方案是推理时对齐,即在无需更新模型参数的情况下优化噪声空间以提升样本保真度。但基于优化或搜索的方法对AR-VDM而言计算上不可行。近期文本到图像(T2I)工作通过前馈噪声精化器在单次前向传播中调节采样噪声来解决此问题。此类噪声精化器能否扩展至AR-VDM?我们发现将T2I噪声精化器简单扩展至AR-VDM会失败,并提出AutoRefiner——一种专为AR-VDM设计的噪声精化器,包含两个关键设计:路径式噪声精化与反射式KV缓存。实验表明,AutoRefiner可作为AR-VDM的高效即插即用模块,通过沿随机去噪路径精化噪声有效提升样本保真度。
引用
@article{arxiv.2512.11203,
title = {AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path},
author = {Zhengyang Yu and Akio Hayakawa and Masato Ishii and Qingtao Yu and Takashi Shibuya and Jing Zhang and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2512.11203},
year = {2025}
}