论场景文本识别中的词汇依赖
计算机视觉与模式识别
2020-05-11 v1 计算与语言
摘要
在公开基准上追求高性能一直是场景文本识别研究的驱动力,并已取得了显著进展。然而,仔细调查揭示了一个惊人的事实:state-of-the-art 方法对包含词表内单词的图像表现良好,但对包含词表外单词的图像泛化能力很差。我们将这一现象称为“词汇依赖”。在本文中,我们建立了一个分析框架,对场景文本识别中的词汇依赖问题进行深入研究。主要发现包括:(1) 词汇依赖普遍存在,即所有现有算法或多或少都表现出这一特征;(2) 基于注意力的解码器在泛化到词表外单词方面表现较弱,而基于分割的解码器在利用视觉特征方面表现良好;(3) 上下文建模与预测层高度耦合。这些发现提供了新的见解,有助于未来的场景文本识别研究。此外,我们提出了一种简单而有效的互学习策略,使两个家族(基于注意力和基于分割)的模型能够协同学习。这一补救措施缓解了词汇依赖问题,并提升了整体的场景文本识别性能。
引用
@article{arxiv.2005.03959,
title = {On Vocabulary Reliance in Scene Text Recognition},
author = {Zhaoyi Wan and Jielei Zhang and Liang Zhang and Jiebo Luo and Cong Yao},
journal= {arXiv preprint arXiv:2005.03959},
year = {2020}
}
备注
CVPR'20