面向鲁棒场景文本图像超分辨率的自显式位置增强方法
计算机视觉与模式识别
2023-08-01 v2
摘要
场景文本图像超分辨率 (STISR) 旨在提升图像质量的同时提高下游场景文本识别准确率,近年来取得了巨大成功。然而,现有多数方法在前向过程中平等对待前景(字符区域)与背景(非字符区域),并忽视了复杂背景的干扰,从而限制了性能。为解决这些问题,本文提出一种新方法 LEMMA,其显式建模字符区域以为超分辨率生成高层文本特定引导。为有效建模字符位置,我们提出位置增强模块,基于注意力图序列提取字符区域特征。此外,我们提出多模态对齐模块执行双向视觉-语义对齐以生成高质量先验引导,并通过所提出的自适应融合模块以自适应方式将其融入超分辨率分支。在 TextZoom 与四个场景文本识别基准上的实验证明了我们的方法优于其他最先进方法。代码见 https://github.com/csguoh/LEMMA。
引用
@article{arxiv.2307.09749,
title = {Towards Robust Scene Text Image Super-resolution via Explicit Location Enhancement},
author = {Hang Guo and Tao Dai and Guanghao Meng and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2307.09749},
year = {2023}
}
备注
Accepted as IJCAI2023 paper