一种通过询问场景文本图像有效的数据增强方法
计算机视觉与模式识别
2026-03-05 v1
摘要
场景文本识别(STR)和手写文本识别(HTR)面临着将图像中的文本内容准确转录为机器可读格式的挑战。传统OCR模型通常直接预测转录结果,这限制了对文本结构的详细推理。我们提出了一种受VQA启发的数据增强框架,通过结构化的问答任务来强化OCR训练。对于每一对图像-文本,生成探询字符级属性(如存在性、位置和频率)的自然语言问题,答案基于ground-truth文本derived。这些辅助任务鼓励更细粒度的推理,OCR模型将视觉特征与文本查询对齐,以便联合推理图像和问题。在WordArt和Esposalles数据集上的实验表明,基线模型 consistently获得改进,CER和WER显著降低。我们的代码已公开于https://github.com/xuyaooo/DataAugOCR。
引用
@article{arxiv.2603.03580,
title = {An Effective Data Augmentation Method by Asking Questions about Scene Text Images},
author = {Xu Yao and Lei Kang},
journal= {arXiv preprint arXiv:2603.03580},
year = {2026}
}
备注
Accepted to ICASSP 2026