PRISM:面向基于扩散的文本图像超分辨率的先验校正与不确定性感知结构建模
计算机视觉与模式识别
2026-05-14 v1
摘要
文本图像超分辨率 (Text-SR) 需要不仅提供视觉上合理的细节合成:轻微的笔画拓扑错误可能会改变字符身份并破坏可读性。现有方法通过更强的识别驱动或生成式先验提高文本保真度,但在严重退化情况下仍面临两个未解决的挑战:从低质量输入提取的文本条件本身可能不可靠,以及合理的全局先验并不完全决定细粒度的笔画边界。我们提出 PRISM,一个单步基于扩散的 Text-SR 框架,通过 Flow-Matching Prior Rectification (FMPR) 和 Structure-guided Uncertainty-aware Residual Encoder (SURE) 解决这两个挑战。FMPR 从成对的低质量/高质量潜在嵌入中构建受训练时的特权先验,并学习一种将退化嵌入传递到该以恢复为导向的先验空间的 flow matching,从而获得更准确可靠的全局文本指导。SURE 进一步预测不确定性感知的结构残差,以选择性地吸收可靠的局部边界证据,同时抑制模糊的笔画线索。这些组件共同启用了在单次扩散恢复过程中实现显式的全局先验校正和局部结构细化。在合成和真实世界基准上的实验表明,PRISM 实现了业界最佳性能,推理时间在毫秒级。我们的数据集和代码将在 https://github.com/faithxuz/PRISM 提供。
引用
@article{arxiv.2605.13027,
title = {PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution},
author = {Zihang Xu and Xiaoyang Liu and Zheng Chen and Yulun Zhang and Xiaokang Yang},
journal= {arXiv preprint arXiv:2605.13027},
year = {2026}
}
备注
Code is available at https://github.com/faithxuz/PRISM