SRSR:利用空间聚焦文本条件提升现实图像超分辨语义准确性
计算机视觉与模式识别
2025-10-28 v1
摘要
现有的基于扩散模型的超分辨方法常因文本条件不完整或不准确,以及跨注意力倾向于关注无关像素的内在趋势,导致语义模糊。这些限制可能引发生成的高分辨率输出中的语义错位和幻觉细节。为此,本文提出一种新型即插即用式的空间聚焦超分辨(Spatially Re-focused Super-Resolution, SRSR)框架,包含两个核心组件:首先,我们引入空间聚焦跨注意力(Spatially Re-focused Cross-Attention, SRCA),通过应用基于视觉的分割掩码在推理阶段细化文本条件,以引导跨注意力。其次,我们引入空间目标分类器自由指导(Spatially Targeted Classifier-Free Guidance, STCFG)机制,以选择性绕过未 grounding 像素上的文本影响,以防止幻觉。广泛的实验在合成数据集和真实世界数据集上表明,SRSR在所有数据集的标准保真度指标(PSNR和SSIM)以及在两个真实世界基准数据集的感知质量指标(LPIPS和DISTS)上均一致优于七个最先进的基线方法,凸显了其在实现高语义忠实度和感知质量方面的有效性。
引用
@article{arxiv.2510.22534,
title = {SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning},
author = {Chen Chen and Majid Abdolshah and Violetta Shevchenko and Hongdong Li and Chang Xu and Pulak Purkait},
journal= {arXiv preprint arXiv:2510.22534},
year = {2025}
}
备注
Accepted at NeurIPS 2025