VARestorer:用于现实图像超分辨率的一步 VAR 蒸馏
计算机视觉与模式识别
2026-04-24 v1 人工智能
机器学习
摘要
最近的视觉自回归模型(VAR)在图像生成方面取得了显著进展,凸显了其在现实图像超分辨率(Real-ISR)中的潜力。然而, 将 VAR 应用于 ISR 仍面临关键挑战。受因果注意力约束的下一尺度预测机制未能充分利用全局低质量(LQ)上下文,导致生成的高质量(HQ)输出模糊且不一致。此外,迭代预测中的误差累积严重损害 ISR 任务的连贯性。为解决这些问题,我们提出了 VARestorer,一个简洁且高效的蒸馏框架,将预训练的文本到图像 VAR 模型转化为一步 ISR 模型。通过利用分布匹配,我们的方法消除了迭代细化的需求,显著减少了误差传播和推理时间。此外,我们引入了具有跨尺度注意力的金字塔图像条件,使其能够实现双向尺度相互作用,充分利用输入图像信息,同时适应自回归机制。这防止了后续 LQ 标记在变换器中被忽略。通过仅对 1.2% 的模型参数进行参数高效适配器微调,该方法保持了原始 VAR 模型的表达能力,同时显著提升了效率。大量实验表明,VARestorer 在 DIV2K 数据集上实现了 72.32 的 MUSIQ 和 0.7669 的 CLIPIQA,推理速度比传统 VAR 推理快 10 倍。
引用
@article{arxiv.2604.21450,
title = {VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution},
author = {Yixuan Zhu and Shilin Ma and Haolin Wang and Ao Li and Yanzhe Jing and Yansong Tang and Lei Chen and Jiwen Lu and Jie Zhou},
journal= {arXiv preprint arXiv:2604.21450},
year = {2026}
}
备注
Accepted in ICLR 2026. Code is available at https://github.com/EternalEvan/VARestorer