PEAN:一种基于扩散的先验增强注意力网络用于场景文本图像超分辨率
计算机视觉与模式识别
2024-07-24 v3
摘要
场景文本图像超分辨率(STISR)旨在同时提升低分辨率场景文本图像的分辨率与可读性,从而增强下游识别任务的性能。场景文本图像中的两个因素——视觉结构与语义信息——显著影响识别性能。为缓解这些因素的影响,本文提出一种先验增强注意力网络(PEAN)。具体而言,利用基于注意力的调制模块,通过巧妙感知图像的局部与全局依赖来理解场景文本图像,而不受文本形状影响。同时,开发了基于扩散的模块以增强文本先验,从而为SR网络提供更好的引导以生成具有更高语义准确性的SR图像。此外,采用多任务学习范式优化网络,使模型能够生成清晰的SR图像。因此,PEAN在TextZoom基准上确立了新的SOTA结果。实验还分析了增强文本先验作为提升SR网络性能手段的重要性。代码见 https://github.com/jdfxzzy/PEAN。
引用
@article{arxiv.2311.17955,
title = {PEAN: A Diffusion-Based Prior-Enhanced Attention Network for Scene Text Image Super-Resolution},
author = {Zuoyan Zhao and Hui Xue and Pengfei Fang and Shipeng Zhu},
journal= {arXiv preprint arXiv:2311.17955},
year = {2024}
}
备注
Accepted by ACMMM 2024