中文

SMILE:面向文本图像识别的序列到序列域适应与最小化隐熵方法

计算机视觉与模式识别 2022-02-25 v1

摘要

使用合成图像训练识别模型在文本识别中已取得显著成果。然而,由于合成与真实世界文本图像之间的域偏移,从真实世界图像中识别文本仍面临挑战。在无人工标注的情况下消除域差异的策略之一是无监督域适应(UDA)。由于序列标注任务的特点,大多数流行的 UDA 方法无法直接应用于文本识别。为解决此问题,我们提出了一种 UDA 方法,在基于序列到序列注意力的模型上结合类别平衡自步学习最小化隐熵。我们的实验表明,所提出的框架在大多数 UDA 文本识别基准上取得了优于现有方法的识别结果。所有代码均已公开。

关键词

引用

@article{arxiv.2202.11949,
  title  = {SMILE: Sequence-to-Sequence Domain Adaption with Minimizing Latent Entropy for Text Image Recognition},
  author = {Yen-Cheng Chang and Yi-Chang Chen and Yu-Chuan Chang and Yi-Ren Yeh},
  journal= {arXiv preprint arXiv:2202.11949},
  year   = {2022}
}