一种用于中英场景文本图像超分辨率的基准
计算机视觉与模式识别
2023-08-08 v1
摘要
场景文本图像超分辨率(STISR)旨在从给定的低分辨率(LR)输入中恢复具有视觉美观且可读文本内容的高分辨率(HR)场景文本图像。现有工作多聚焦于恢复字符结构相对简单的英文文本,而针对结构更为多样复杂的更具挑战性的中文文本的研究甚少。本文提出一个真实世界的中英基准数据集 Real-CE,用于 STISR 任务,重点恢复结构复杂的中文字符。该基准提供 1,935/783 对真实世界 LR-HR 文本图像对(共含 33,789 文本行),用于 2 和 4 缩放模式的训练/测试,并配有详细标注,包括检测框与文本转写。此外,我们设计了一种边缘感知学习方法,在图像与特征域提供结构监督,以有效重建中文字符的密集结构。我们在提出的 Real-CE 基准上开展实验,并评估了现有 STISR 模型在使用与不使用我们边缘感知损失时的表现。该基准(含数据与源代码)发布于 https://github.com/mjq11302010044/Real-CE。
引用
@article{arxiv.2308.03262,
title = {A Benchmark for Chinese-English Scene Text Image Super-resolution},
author = {Jianqi Ma and Zhetong Liang and Wangmeng Xiang and Xi Yang and Lei Zhang},
journal= {arXiv preprint arXiv:2308.03262},
year = {2023}
}
备注
Accepted by ICCV2023