通过双先验调制网络提升场景文本图像超分辨率
计算机视觉与模式识别
2023-12-01 v2
摘要
场景文本图像超分辨率(STISR)旨在同时提高文本图像的分辨率与清晰度,其生成图像将显著影响下游任务的性能。尽管已有大量进展,现有方法仍存在两个关键问题:(1) 它们忽略了文本的全局结构,限制了场景文本的语义确定性。(2) 现有工作中采用的先验(如文本先验或笔画先验)是从预训练的文本识别器中提取的。也就是说,此类先验受到域差距的影响,包括由恶劣成像条件引起的低分辨率和模糊,导致错误的引导。我们的工作针对这些差距,提出了一种即插即用模块,称为双先验调制网络(DPMN),它利用双图像级先验为现有方法带来性能提升。具体而言,设计了两类先验引导的细化模块,分别利用前一层低质量SR图像的文本掩码或图形识别结果,以改善文本的结构清晰度和语义准确性。随后的注意力机制据此调制两幅质量增强的图像,以获得更优的SR结果。大量实验验证,我们的方法在基准上相比五种典型方法提升了图像质量并增强了下游任务性能。充分的可视化与消融研究展示了所提DPMN的优势。代码见:https://github.com/jdfxzzy/DPMN。
引用
@article{arxiv.2302.10414,
title = {Improving Scene Text Image Super-resolution via Dual Prior Modulation Network},
author = {Shipeng Zhu and Zuoyan Zhao and Pengfei Fang and Hui Xue},
journal= {arXiv preprint arXiv:2302.10414},
year = {2023}
}
备注
Accepted by AAAI-2023