文本即文本,无论何种形式:利用知识蒸馏统一文本识别
计算机视觉与模式识别
2021-07-29 v2
摘要
文本识别仍是计算机视觉中基础且被广泛研究的课题,主要因其大量商业应用。然而该问题自身的挑战性导致了研究工作的碎片化:处理日常场景文本的 Scene Text Recognition(场景文本识别,STR)与处理手写文本的 Handwriting Text Recognition(手写文本识别,HTR)。本文首次主张将二者统一——旨在以单一模型媲美两个独立的最先进STR与HTR模型。我们首先表明,由于内在挑战的差异,STR与HTR模型的跨用会引发显著性能下降。随后我们通过引入基于知识蒸馏(KD)的框架来解决其统一问题。但这并非易事,主要由于文本序列变长且具序列性,使得多数面向全局定长数据的现有KD技术不再适用。为此,我们提出三种蒸馏损失,均专门设计以应对上述文本识别的独特特性。实证表明,我们提出的统一模型性能与独立模型相当,某些情况下甚至超越。消融研究证明,如两阶段框架及域适应/泛化替代方案等朴素基线表现不佳,进一步验证了我们设计的合理性。
引用
@article{arxiv.2107.12087,
title = {Text is Text, No Matter What: Unifying Text Recognition using Knowledge Distillation},
author = {Ayan Kumar Bhunia and Aneeshan Sain and Pinaki Nath Chowdhury and Yi-Zhe Song},
journal= {arXiv preprint arXiv:2107.12087},
year = {2021}
}
备注
IEEE International Conference on Computer Vision (ICCV), 2021