中文

面向多语言文本识别的任务分组方法

计算机视觉与模式识别 2022-10-17 v1

摘要

由于英语和数字的流行及其相应数据集的存在,大多数现有的 OCR 方法聚焦于字母数字字符。在将字符扩展到难以处理的语言时,近期方法表明,使用不同的识别头训练不同文字系统,相比将所有语言的字符合并到同一识别头中,可大幅提升端到端识别的准确率。然而,我们假定某些语言之间的相似性可允许共享模型参数并从联合训练中获益。但语言分组的确定并非显而易见。为此,我们提出一种自动化的多语言文本识别方法,其包含使用 Gumbel-Softmax 的任务分组与分配模块,并引入任务分组损失与加权识别损失,以实现模型与分组模块的同步训练。在 MLT19 上的实验为我们的假设提供了证据:在将所有任务合并与将所有任务分离之间,存在一种能实现更优任务分组/分离配置的中间方案。

关键词

引用

@article{arxiv.2210.07423,
  title  = {Task Grouping for Multilingual Text Recognition},
  author = {Jing Huang and Kevin J Liang and Rama Kovvuri and Tal Hassner},
  journal= {arXiv preprint arXiv:2210.07423},
  year   = {2022}
}

备注

ECCV 2022: Text in Everything (TIE) Workshop (Oral)