面向场景文本识别的数据增强
计算机视觉与模式识别
2021-08-17 v1
摘要
场景文本识别(STR)是计算机视觉中一项具有挑战性的任务,因为自然场景中的文本外观可能性极多。大多数STR模型依赖合成数据集进行训练,因为不存在足够大且公开可用的带标注真实数据集。由于STR模型使用真实数据评估,训练与测试数据分布的不匹配导致模型性能不佳,尤其在受噪声、伪影、几何、结构等影响的困难文本上。本文中,我们引入STRAug,其由36个为STR设计的图像增强函数组成。每个函数模拟自然场景中、由相机传感器引起或信号处理操作诱发但在训练数据集中代表性不足 certain 文本图像属性。当通过RandAugment应用于强基线模型时,STRAug在常规与非常规测试数据集上显著提升STR模型的总体绝对准确率:Rosetta提升2.10%、R2AM提升1.48%、CRNN提升1.30%、RARE提升1.35%、TRBA提升1.06%、GCRNN提升0.89%。STRAug函数所提供的API的多样性与简洁性使得现有STR数据增强方法易于复现与验证。STRAug可在 https://github.com/roatienza/straug 获取。
引用
@article{arxiv.2108.06949,
title = {Data Augmentation for Scene Text Recognition},
author = {Rowel Atienza},
journal= {arXiv preprint arXiv:2108.06949},
year = {2021}
}
备注
Interactive Labeling and Data Augmentation for Vision ICCV 2021 Workshop