I2C2W:用于精确场景文本识别的图到字符到词 Transformer
计算机视觉与模式识别
2022-12-20 v3
摘要
利用自然语言处理的进展,近期大多数场景文本识别器采用编码器-解码器架构,其中文本图像首先被转换为代表性特征,然后通过“顺序解码”得到字符序列。然而,场景文本图像受到来自不同来源的丰富噪声(如复杂背景和几何畸变)的影响,这些噪声常使解码器混淆,并导致在含噪解码时间步上视觉特征的错误对齐。本文提出 I2C2W,一种通过将场景文本识别分解为两个相互关联任务从而对几何和光度退化具有容忍性的新型场景文本识别技术。第一个任务聚焦于图到字符(I2C)映射,基于视觉特征的不同对齐以非顺序方式从图像中检测一组字符候选。第二个任务处理字符到词(C2W)映射,通过从检测到的字符候选中解码单词来识别场景文本。直接从字符语义(而非含噪图像特征)学习可有效纠正错误检测的字符候选,从而大幅提升最终文本识别准确率。在九个公开数据集上的大量实验表明,所提出的 I2C2W 在具有各种弯曲和透视畸变的挑战性场景文本数据集上大幅优于当前最优方法(SOTA)。它在多个正常场景文本数据集上也取得了极具竞争力的识别性能。
引用
@article{arxiv.2105.08383,
title = {I2C2W: Image-to-Character-to-Word Transformers for Accurate Scene Text Recognition},
author = {Chuhui Xue and Jiaxing Huang and Wenqing Zhang and Shijian Lu and Changhu Wang and Song Bai},
journal= {arXiv preprint arXiv:2105.08383},
year = {2022}
}
备注
Accepted by special issue Transformer Models in Vision of the Transactions on Pattern Analysis and Machine Intelligence