C3-STISR:基于三重线索的场景文本图像超分辨率
计算机视觉与模式识别
2022-05-02 v1
摘要
场景文本图像超分辨率(STISR)被视为从低分辨率场景文本图像进行文本识别的重要预处理任务。近期多数方法利用识别器的反馈作为线索来引导超分辨率。然而,直接使用识别线索存在两个问题:1)兼容性。其以概率分布形式存在,与 STISR(一种像素级任务)有明显模态鸿沟;2)不准确性。其通常包含错误信息,从而会误导主任务并降低超分辨率性能。本文提出一种新方法 C3-STISR,联合利用识别器反馈、视觉与语言信息作为线索来引导超分辨率。其中,视觉线索来自识别器预测的文本图像,信息丰富且与 STISR 任务更兼容;语言线索由预训练字符级语言模型生成,能够纠正预测文本。我们为这三重跨模态线索设计了有效的提取与融合机制,以生成全面且统一的超分辨率引导。在 TextZoom 上的大量实验表明,C3-STISR 在保真度与识别性能上均优于 SOTA 方法。代码见 https://github.com/zhaominyiz/C3-STISR。
引用
@article{arxiv.2204.14044,
title = {C3-STISR: Scene Text Image Super-resolution with Triple Clues},
author = {Minyi Zhao and Miao Wang and Fan Bai and Bingjia Li and Jie Wang and Shuigeng Zhou},
journal= {arXiv preprint arXiv:2204.14044},
year = {2022}
}
备注
Accepted by IJCAI 2022