中文

基于Transformer和TaylorShift的细粒度图像超分辨率

计算机视觉与模式识别 2025-11-04 v2 人工智能 机器学习 多媒体

摘要

Transformer-based架构最近提高了图像重建质量的超分辨率(SR)模型。然而,由于注意力成本呈二次增长和粗糙的patch嵌入削弱了像素级保真度,其可扩展性仍受限。我们提出TaylorIR,一个即插即用的框架,强制执行1x1 patch嵌入以实现像素级推理,并用基于Taylor级数的数注意力机制取代常规自注意力,使其实现近线性复杂度的全token相互作用。在多个SR基准测试中,TaylorIR delivers state-of-the-art performance while reducing memory consumption by up to 60%,有效桥接了细粒度细节恢复与高效transformer扩展之间的差距。

关键词

引用

@article{arxiv.2411.10231,
  title  = {A Low-Resolution Image is Worth 1x1 Words: Enabling Fine Image Super-Resolution with Transformers and TaylorShift},
  author = {Sanath Budakegowdanadoddi Nagaraju and Brian Bernhard Moser and Tobias Christian Nauen and Stanislav Frolov and Federico Raue and Andreas Dengel},
  journal= {arXiv preprint arXiv:2411.10231},
  year   = {2025}
}