秩分解隐式神经偏置:借助 FlashAttention 扩展超分辨率 Transformer
机器学习
2026-03-10 v1 人工智能
摘要
最近的超分辨率(SR)方法主要采用 Transformer 以利用其强大的长程建模能力和卓越的表示能力。然而,大多数 SR Transformer 依赖相对位置偏置(RPB),这限制了其利用诸如 FlashAttention 之类的硬件高效注意力内核。这种限制在训练和推理期间造成了巨大的计算负担,严重限制了通过扩大训练补丁大小或自注意力窗口来扩展 SR Transformer 的可能性。因此,与其他领域主动利用 Transformer 本身可扩展性不同,SR Transformer 仍主要专注于有效利用有限的感受野。本文提出了秩分解隐式神经偏置(RIB),一种替代 RPB 的方法,使 SR Transformer 能够使用 FlashAttention。具体而言,RIB 使用低秩隐式神经表示来近似位置偏置,并以通道方式拼接到像素内容标记中,将注意力得分计算中的元素级偏置添加转换为点积运算。进一步,我们引入卷积局部注意力和循环窗口策略,以充分利用 RIB 和 FlashAttention 所启发的长程相互作用优势。我们将窗口大小扩大至\textbf{96×96},同时扩大训练补丁大小和数据集大小,最大化 Transformer 在 SR 任务中的优势。结果是,我们的网络在 Urban100×2 上实现了 \textbf{35.63 dB PSNR},训练和推理时间分别较 RPB 基于 SR Transformer(PFT)减少 \textbf{2.1×} 和 \textbf{2.9×}。
引用
@article{arxiv.2603.06738,
title = {Rank-Factorized Implicit Neural Bias: Scaling Super-Resolution Transformer with FlashAttention},
author = {Dongheon Lee and Seokju Yun and Jaegyun Im and Youngmin Ro},
journal= {arXiv preprint arXiv:2603.06738},
year = {2026}
}