基于Transformer和TaylorShift的细粒度图像超分辨率
计算机视觉与模式识别
2025-11-04 v2 人工智能
机器学习
多媒体
摘要
Transformer-based架构最近提高了图像重建质量的超分辨率(SR)模型。然而,由于注意力成本呈二次增长和粗糙的patch嵌入削弱了像素级保真度,其可扩展性仍受限。我们提出TaylorIR,一个即插即用的框架,强制执行1x1 patch嵌入以实现像素级推理,并用基于Taylor级数的数注意力机制取代常规自注意力,使其实现近线性复杂度的全token相互作用。在多个SR基准测试中,TaylorIR delivers state-of-the-art performance while reducing memory consumption by up to 60%,有效桥接了细粒度细节恢复与高效transformer扩展之间的差距。
引用
@article{arxiv.2411.10231,
title = {A Low-Resolution Image is Worth 1x1 Words: Enabling Fine Image Super-Resolution with Transformers and TaylorShift},
author = {Sanath Budakegowdanadoddi Nagaraju and Brian Bernhard Moser and Tobias Christian Nauen and Stanislav Frolov and Federico Raue and Andreas Dengel},
journal= {arXiv preprint arXiv:2411.10231},
year = {2025}
}