中文

隐式特征对齐:将文本识别器转化为文本 spotting 器

计算机视觉与模式识别 2021-06-11 v1

摘要

文本识别是一个热门研究课题,伴随诸多相关挑战。尽管近年来取得显著进展,文本识别任务本身仍受限于读取裁剪后的行文本图像,并作为光学字符识别(OCR)系统的子任务。因此,最终文本识别结果受限于文本检测器的性能。在本文中,我们提出一种简单、优雅且有效的范式,称为隐式特征对齐(IFA),其可轻松集成到当前文本识别器中,从而产生一种称为 IFAinference 的新型推理机制。这使得普通文本识别器能够处理多行文本,从而彻底摆脱文本检测。具体而言,我们将 IFA 集成到两种最主流的文本识别流派(基于注意力和基于 CTC)中,并提出注意力引导的密集预测(ADP)与扩展 CTC(ExCTC)。此外,提出基于 Wasserstein 的空洞聚合交叉熵(WH-ACE)以抑制负向预测,辅助训练 ADP 与 ExCTC。我们通过实验证明,IFA 在端到端文档识别任务上取得最先进(state-of-the-art)性能,同时保持最快速度,且 ADP 与 ExCTC 在不同应用场景视角下互为补充。代码将发布于 https://github.com/WangTianwei/Implicit-feature-alignment。

关键词

引用

@article{arxiv.2106.05920,
  title  = {Implicit Feature Alignment: Learn to Convert Text Recognizer to Text Spotter},
  author = {Tianwei Wang and Yuanzhi Zhu and Lianwen Jin and Dezhi Peng and Zhe Li and Mengchao He and Yongpan Wang and Canjie Luo},
  journal= {arXiv preprint arXiv:2106.05920},
  year   = {2021}
}

备注

Accepted to CVPR 2021