以标注数据验证的繁体中文合成数据集用于场景文本识别
计算机视觉与模式识别
2022-08-09 v2
摘要
场景文本识别(STR)已在学术界与工业界被广泛研究。训练文本识别模型常需要大量标注数据,但数据标注可能困难、昂贵或耗时,尤其对于繁体中文文本识别。据我们所知,公开用于繁体中文文本识别的数据集十分缺乏。本文提出一个繁体中文合成数据引擎框架,旨在提升文本识别模型性能。我们生成了超过2000万条合成数据,并收集了超过7000条人工标注数据TC-STR 7k-word作为基准。实验结果表明,文本识别模型无论是使用我们生成的合成数据从头训练,还是进一步用TC-STR 7k-word微调,都能获得明显更好的准确率。
引用
@article{arxiv.2111.13327,
title = {Traditional Chinese Synthetic Datasets Verified with Labeled Data for Scene Text Recognition},
author = {Yi-Chang Chen and Yu-Chuan Chang and Yen-Cheng Chang and Yi-Ren Yeh},
journal= {arXiv preprint arXiv:2111.13327},
year = {2022}
}
备注
Accepted in ICPR Workshop DLVDR 2022