用于多语言场景文本识别的带有自适应n-grams嵌入的增强型Transformer
计算与语言
2023-03-01 v1
摘要
尽管视觉Transformer在提升基于图像任务的性能方面取得了巨大成功,但由于多语言文本视觉外观的复杂性,关于将Transformer应用于多语言场景文本识别的工作鲜有报道。为了填补这一空白,本文提出了一种带有n-grams嵌入和跨语言校正的增强型Transformer架构(TANGER)。TANGER由一个具有视觉图像单块嵌入的主Transformer和一个具有自适应n-grams嵌入的辅助Transformer组成,后者旨在灵活探索相邻视觉块之间的潜在相关性,这对于从多语言场景文本中提取特征至关重要。跨语言校正是通过一个同时考虑语言识别和上下文连贯性评分的损失函数来实现的。在四个广泛使用的基准数据集以及一个包含从印度尼西亚旅游场景中收集的印尼语、英语和中文的新多语言场景文本数据集上进行了广泛的比较研究。我们的实验结果表明,与现有技术相比,TANGER表现显著更优,尤其是在处理复杂的多语言场景文本时。
引用
@article{arxiv.2302.14261,
title = {Augmented Transformers with Adaptive n-grams Embedding for Multilingual Scene Text Recognition},
author = {Xueming Yan and Zhihang Fang and Yaochu Jin},
journal= {arXiv preprint arXiv:2302.14261},
year = {2023}
}