中文

面向低资源语言的弱监督场景文本生成

计算机视觉与模式识别 2023-06-28 v2

摘要

大量标注训练图像对于训练成功的场景文本识别模型至关重要。然而,收集充足的数据集可能是劳动密集且昂贵的过程,尤其对于低资源语言。为应对此挑战,自动生成文本数据在缓解该问题方面已显示出前景。不幸的是,现有的场景文本生成方法通常依赖大量成对数据,而这对低资源语言难以获取。在本文中,我们提出一种新颖的弱监督场景文本生成方法,利用少量识别级标签作为弱监督。所提方法能够通过跨语言生成产生大量具有多样背景和字体风格的场景文本图像。我们的方法解耦场景文本图像的内容与风格特征,前者表示文本信息,后者表示字体、对齐和背景等特性。为保留生成图像的完整内容结构,我们引入了集成注意力模块。此外,为弥合不同语言风格的风格差距,我们融入了一个预训练字体分类器。我们使用最先进的场景文本识别模型评估了我们的方法。实验表明,我们生成的场景文本显著提升了场景文本识别准确率,并在与其他生成方法互补时有助于达到更高准确率。

关键词

引用

@article{arxiv.2306.14269,
  title  = {Weakly Supervised Scene Text Generation for Low-resource Languages},
  author = {Yangchen Xie and Xinyuan Chen and Hongjian Zhan and Palaiahankote Shivakum and Bing Yin and Cong Liu and Yue Lu},
  journal= {arXiv preprint arXiv:2306.14269},
  year   = {2023}
}