SeG-SR: 通过视觉-语言模型将语义知识集成至遥感图像超分辨率
计算机视觉与模式识别
2025-10-24 v2
摘要
高分辨率(HR)遥感图像在城市规划和环境监测等广泛应用中发挥着至关重要的作用。然而,由于传感器和数据传输链路的限制,实际获取的图像通常会出现分辨率退化。遥感图像超分辨率(RSISR)旨在从低分辨率(LR)输入中重建 HR 图像,为直接获取 HR 图像提供了一种经济高效的替代方案。现有的 RSISR 方法主要关注像素空间中的低级特征,而忽略了对遥感场景的高级理解。这可能导致重建结果中出现语义不一致的伪影。受此观察启发,我们的工作旨在探索高级语义知识在提升 RSISR 性能中的作用。我们提出了一个语义引导超分辨率框架 SeG-SR,该框架利用视觉-语言模型(VLM)从输入图像中提取语义知识,并利用其指导超分辨率(SR)过程。具体而言,我们首先设计了一个语义特征提取模块(SFEM),利用预训练的 VLM 从遥感图像中提取语义知识。接着,我们提出了一个语义定位模块(SLM),从提取的语义知识中导出一系列语义指导。最后,我们开发了一个可学习调制模块(LMM),使用语义指导来调制 SR 网络提取的特征,从而有效地将高级场景理解纳入 SR 流程中。我们通过大量实验验证了 SeG-SR 的有效性和泛化能力:SeG-SR 在三个数据集上取得了最先进的性能,并在各种 SR 架构中持续提升性能。值得注意的是,对于 UCMerced 数据集上的 x4 SR 任务,它达到了 29.3042 dB 的 PSNR 和 0.7961 的 SSIM。
引用
@article{arxiv.2505.23010,
title = {SeG-SR: Integrating Semantic Knowledge into Remote Sensing Image Super-Resolution via Vision-Language Model},
author = {Bowen Chen and Keyan Chen and Mohan Yang and Zhengxia Zou and Zhenwei Shi},
journal= {arXiv preprint arXiv:2505.23010},
year = {2025}
}