利用资源丰富语言数据集实现资源贫乏语言的端到端场景文本识别
计算机视觉与模式识别
2021-11-25 v1 机器学习
摘要
本文提出了一种新颖的端到端场景文本识别训练方法。端到端场景文本识别,特别是使用基于 Transformer 的编码器-解码器模型时,能提供高识别准确率。为训练一个高精度的端到端模型,我们需要为目标语言准备一个大规模的图像-文本配对数据集。然而,收集此类数据十分困难,尤其对于资源贫乏的语言。为克服这一困难,我们提出的方法利用资源丰富语言(如英语)中已准备好的大规模数据集来训练资源贫乏语言的编码器-解码器模型。我们的核心思想是构建一个模型,其中编码器反映多语言知识,而解码器专精于资源贫乏语言的知识。为此,所提方法通过使用一个结合了资源贫乏语言数据集和资源丰富语言数据集的多语言数据集来预训练编码器,以学习场景文本识别的语言不变性知识。同时,该方法通过使用资源贫乏语言的数据集来预训练解码器,使其更好地适应资源贫乏语言。在一个小型公开数据集上进行的日语场景文本识别实验证明了所提方法的有效性。
引用
@article{arxiv.2111.12276,
title = {Utilizing Resource-Rich Language Datasets for End-to-End Scene Text Recognition in Resource-Poor Languages},
author = {Shota Orihashi and Yoshihiro Yamazaki and Naoki Makishima and Mana Ihori and Akihiko Takashima and Tomohiro Tanaka and Ryo Masumura},
journal= {arXiv preprint arXiv:2111.12276},
year = {2021}
}
备注
Accept as short paper at ACM MMAsia 2021