RPT-SR:面向红外图像超分辨率的区域先验注意力 Transformer
计算机视觉与模式识别
2026-02-18 v1 人工智能
摘要
通用超分辨率模型,特别是 Vision Transformer,已取得显著成功,但在监控和自动驾驶等常见红外成像场景中表现不佳,这些场景 operate from fixed or nearly-static viewpoints。这些模型未能利用此类场景中固有的强大且持久的空间先验,导致冗余学习和次优性能。为此,我们提出面向红外图像超分辨率的区域先验注意力 Transformer (RPT-SR),一种新型架构,显式地将场景布局信息编码到注意力机制中。我们的核心贡献是双 token 框架,将 (1) 可学习的区域先验 token 作为场景全局结构的持久记忆,与 (2) 捕获当前输入帧特定内容的局部 token 融合。通过将这些 token 用于注意力,我们的模型允许先验动态调制局部重建过程。广泛的实验验证了我们方法的有效性。虽然大多数先前工作仅关注单一红外波段,但我们通过在涵盖长波 (LWIR) 和短波 (SWIR) 两种光谱的多样化数据集上建立新的最先进性能,展示了 RPT-SR 的广泛适用性和灵活性。
引用
@article{arxiv.2602.15490,
title = {RPT-SR: Regional Prior attention Transformer for infrared image Super-Resolution},
author = {Youngwan Jin and Incheol Park and Yagiz Nalcakan and Hyeongjin Ju and Sanghyeop Yeo and Shiho Kim},
journal= {arXiv preprint arXiv:2602.15490},
year = {2026}
}