中文

文本即文本,无论何种形式:利用知识蒸馏统一文本识别

计算机视觉与模式识别 2021-07-29 v2

摘要

文本识别仍是计算机视觉中基础且被广泛研究的课题,主要因其大量商业应用。然而该问题自身的挑战性导致了研究工作的碎片化:处理日常场景文本的 Scene Text Recognition(场景文本识别,STR)与处理手写文本的 Handwriting Text Recognition(手写文本识别,HTR)。本文首次主张将二者统一——旨在以单一模型媲美两个独立的最先进STR与HTR模型。我们首先表明,由于内在挑战的差异,STR与HTR模型的跨用会引发显著性能下降。随后我们通过引入基于知识蒸馏(KD)的框架来解决其统一问题。但这并非易事,主要由于文本序列变长且具序列性,使得多数面向全局定长数据的现有KD技术不再适用。为此,我们提出三种蒸馏损失,均专门设计以应对上述文本识别的独特特性。实证表明,我们提出的统一模型性能与独立模型相当,某些情况下甚至超越。消融研究证明,如两阶段框架及域适应/泛化替代方案等朴素基线表现不佳,进一步验证了我们设计的合理性。

关键词

引用

@article{arxiv.2107.12087,
  title  = {Text is Text, No Matter What: Unifying Text Recognition using Knowledge Distillation},
  author = {Ayan Kumar Bhunia and Aneeshan Sain and Pinaki Nath Chowdhury and Yi-Zhe Song},
  journal= {arXiv preprint arXiv:2107.12087},
  year   = {2021}
}

备注

IEEE International Conference on Computer Vision (ICCV), 2021