中文

一种通过询问场景文本图像有效的数据增强方法

计算机视觉与模式识别 2026-03-05 v1

摘要

场景文本识别(STR)和手写文本识别(HTR)面临着将图像中的文本内容准确转录为机器可读格式的挑战。传统OCR模型通常直接预测转录结果,这限制了对文本结构的详细推理。我们提出了一种受VQA启发的数据增强框架,通过结构化的问答任务来强化OCR训练。对于每一对图像-文本,生成探询字符级属性(如存在性、位置和频率)的自然语言问题,答案基于ground-truth文本derived。这些辅助任务鼓励更细粒度的推理,OCR模型将视觉特征与文本查询对齐,以便联合推理图像和问题。在WordArt和Esposalles数据集上的实验表明,基线模型 consistently获得改进,CER和WER显著降低。我们的代码已公开于https://github.com/xuyaooo/DataAugOCR。

关键词

引用

@article{arxiv.2603.03580,
  title  = {An Effective Data Augmentation Method by Asking Questions about Scene Text Images},
  author = {Xu Yao and Lei Kang},
  journal= {arXiv preprint arXiv:2603.03580},
  year   = {2026}
}

备注

Accepted to ICASSP 2026