低资源语言文本图像生成:基于双向翻译学习
计算机视觉与模式识别
2024-09-27 v1
摘要
低资源语言的场景文本识别经常因来自真实场景的训练数据集稀缺而面临挑战。本研究提出一种新方法,通过模拟来自高资源语言中真实文本图像的风格来生成低资源语言的文本图像。该方法利用以二元状态(“合成”和“真实”)为条件的扩散模型进行训练。该模型的训练涉及双向翻译任务,即将纯文本图像转换为基于二元状态的合成文本图像或真实文本图像。这一方法不仅有效地区分了两个领域,还促进了模型对目标语言中字符的显式识别。此外,为增强生成文本图像的准确性和多样性,我们引入两种引导技术:保真度-多样性平衡引导和保真度增强引导。我们的实验结果表明,本文提出的框架生成的文本图像能够显著提高面向低资源语言的场景文本识别模型性能。
引用
@article{arxiv.2409.17747,
title = {Text Image Generation for Low-Resource Languages with Dual Translation Learning},
author = {Chihiro Noguchi and Shun Fukuda and Shoichiro Mihara and Masao Yamanaka},
journal= {arXiv preprint arXiv:2409.17747},
year = {2024}
}
备注
23 pages, 11 figures