高效单步扩散恢复模型:紧凑 Token 压缩与线性注意力
计算机视觉与模式识别
2026-05-25 v1
摘要
现实世界的图像超分辨率旨在从复杂且未知的真实降质中恢复高质量图像。然而,现有的生成式真实超分辨率方法在很大程度上继承了针对高分辨率图像合成开发的稠密潜在表征和二次代价全局建模范式,导致计算量、内存使用和推理延迟随分辨率不利地增长,从而限制了实际部署。我们认为,关键瓶颈不在于恢复先验不足,而在于高分辨率恢复期间的过度 Token 冗余和高成本 Token 相互作用。针对这一观察,我们从紧凑潜在表征和线性复杂度建模的角度重新审视真实超分辨率问题,提出了 SANA-SR—an 高效的单步骤恢复框架。具体而言,SANA-SR 采用深度压缩自编码器,压缩比为 32 倍,显著减少潜在 Token 的数量,同时保留恢复相关的结构和纹理。在这一紧凑潜在空间上,我们引入了带 LoRA 微调的线性注意力 DiT,实现了具有线性复杂度的高效高分辨率恢复。广泛的基准数据集上的实验表明,SANA-SR 在定量性能上与现有方法高度竞争,甚至常常表现更好,同时恢复更清晰、更真实的纹理。而且,在剪枝后,部署模型运行仅需 0.019 秒,计算量为 407.95G MAC,参数量为 344M,凸显其在实际移动端部署中的强大潜力。
引用
@article{arxiv.2605.23451,
title = {Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention},
author = {Bingtian Qiao and Yue Shi and Yingjie Zhou and Yong Guo and Guangtao Zhai and Jiezhang Cao},
journal= {arXiv preprint arXiv:2605.23451},
year = {2026}
}