基于泰勒展开近似与大场域接收的图像超分辨率重建
计算机视觉与模式识别
2024-08-02 v1 人工智能
图像与视频处理
摘要
自相似技术在盲超分辨率重建中蓬勃发展,因为可以准确估计低分辨率图像中涉及的退化类型。然而,自相似计算中的高维矩阵乘法会消耗大量计算成本。我们发现,高维注意力图来源于 Query 与 Key 之间的矩阵乘法,随后经过 softmax 函数。该 softmax 使 Query 与 Key 之间的矩阵乘法不可分离,为简化计算复杂度带来了巨大挑战。为解决此问题,我们首先提出二阶泰勒展开近似(STEA)以分离 Query 与 Key 的矩阵乘法,将复杂度从 降低到 。然后,我们设计了多尺度大场域接收(MLFR)以补偿 STEA 造成的性能退化。最后,我们将这两个核心设计应用于实验室和真实场景,分别构建了 LabNet 和 RealNet。在五个合成数据集上的大量实验结果表明,我们的 LabNet 在定性和定量评估中建立了新的基准。在 RealWorld38 数据集上,我们的 RealNet 在视觉质量上优于现有方法。消融研究进一步验证了 STEA 和 MLFR 对 LabNet 和 RealNet 框架的贡献。
引用
@article{arxiv.2408.00470,
title = {Image Super-Resolution with Taylor Expansion Approximation and Large Field Reception},
author = {Jiancong Feng and Yuan-Gen Wang and Mingjie Li and Fengchuang Xing},
journal= {arXiv preprint arXiv:2408.00470},
year = {2024}
}