你需要文本校正吗?面向免校正场景文本识别的软注意力掩码嵌入
计算机视觉与模式识别
2026-05-19 v1
摘要
端到端场景文本识别在单一框架内统一了文本检测与识别,在深度学习的推动下取得了显著进展。然而,由于多尺度变化、任意文本形状以及复杂背景干扰,现有大多数方法仍存在掩码提议不完整的问题,从而降低了识别准确率。本文提出了一种新颖的软注意力掩码嵌入模块(SAME),该模块利用 Transformer 编码器的全局感受野来编码高层特征并计算软注意力权重,随后将其与预测掩码分层嵌入,生成精细的文本边界感知掩码,有效抑制背景噪声。基于该模块,我们提出了 SAME-Net,这是一个鲁棒的端到端文本识别框架,既不需要字符级标注,也不需要辅助文本校正模块。由于软注意力机制是完全可微的,识别损失梯度可以通过 SAME 模块反向传播到检测分支,从而实现检测与识别目标的联合优化。在具有挑战性的基准测试上的大量实验证明了我们方法的有效性:SAME-Net 在任意形状的 Total-Text 数据集上取得了 84.02% 的端到端 H-mean,在全词典准确率上无需额外训练数据即超越了此前最先进的 GLASS 1.02%,并在多方向的 ICDAR 2015 数据集上获得了具有竞争力的 83.4% 强词典结果。
引用
@article{arxiv.2605.18173,
title = {Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting},
author = {Antonio Colombo and Giovanni Bianchi},
journal= {arXiv preprint arXiv:2605.18173},
year = {2026}
}