LinearSR:解锁线性注意力实现稳定高效图像超分辨率
计算机视觉与模式识别
2026-03-24 v4
摘要
用于图像超分辨率(SR)的生成模型正日益强大,但其对自注意力机制二次复杂度(O(N^2))的依赖导致了主要计算瓶颈。线性注意力提供了O(N)的解决方案,但其在实现逼真光学感SR方面的潜力仍基本未被充分利用,过去受制于一系列相互关联且之前未解决的挑战。本文引入LinearSR,一个综合性框架,首次系统性地克服了这些关键障碍。具体而言,我们提出一种基于“膝点”的早期停止引导微调(ESGF)策略,解决了导致模型灾难性发散的根本性训练不稳定问题。此外,我们采用基于信噪比(SNR)的混合专家(MoE)架构,以缓解经典的感知-失真权衡。最后,我们建立一种轻量级的指导范式——TAG,源自“精度优于数量”的原则。我们得到的LinearSR模型同时实现了领先的感知质量与卓越的效率。其核心扩散前向传递(1-NFE)实现了SOTA水平的速度,而其整体多步骤推理时间仍保持高度竞争力。这一工作为将线性注意力应用于逼真光学感SR领域提供了第一个稳健的方法,确立了高效生成式超分辨率未来研究的基础范式。
引用
@article{arxiv.2510.08771,
title = {LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution},
author = {Xiaohui Li and Shaobin Zhuang and Shuo Cao and Yang Yang and Yuandong Pu and Qi Qin and Siqi Luo and Bin Fu and Yihao Liu},
journal= {arXiv preprint arXiv:2510.08771},
year = {2026}
}
备注
Camera Ready of ICLR2026