中文

改进面向字符级长尾分布的场景文本识别

计算机视觉与模式识别 2023-04-19 v1 计算与语言

摘要

尽管场景文本识别(STR)近期取得了显著进展,但大多数研究主要聚焦于仅包含少量字符的英语。然而,STR模型在字符数量众多的语言(如中文和韩文)上表现出较大的性能退化,尤其是在因这类语言字符长尾分布而罕见出现的字符上。为解决此问题,我们使用具有不同字符级分布(如均衡分布与长尾分布)的合成数据集进行了实证分析。虽然在不考虑上下文的情况下增加大量尾部类有助于模型正确识别单个字符,但使用此类合成数据集训练会干扰模型学习上下文信息(即字符间关系),而该信息对于预测整个单词同样重要。基于这一动机,我们提出了一种新颖的上下文感知与无上下文专家网络(CAFE-Net),使用两个专家:1)上下文感知专家利用由日常生活常用词组成的长尾数据集学习上下文表示;2)无上下文专家通过采用字符数量均衡的数据集专注于正确预测单个字符。通过训练两个专家分别专注于学习上下文与视觉表示,我们提出了一种新颖的置信度集成方法来弥补各自专家的局限性。实验表明,CAFE-Net提升了在包含大量字符的语言上的STR性能。此外,我们展示了CAFE-Net可轻松应用于各类STR模型。

关键词

引用

@article{arxiv.2304.08592,
  title  = {Improving Scene Text Recognition for Character-Level Long-Tailed Distribution},
  author = {Sunghyun Park and Sunghyo Chung and Jungsoo Lee and Jaegul Choo},
  journal= {arXiv preprint arXiv:2304.08592},
  year   = {2023}
}

备注

17 pages