FastTextSpotter:用于多语言场景文本检测的高效Transformer
计算机视觉与模式识别
2025-03-13 v2
摘要
场景文本在结构化和非结构化环境中呈现广泛,这为光学字符识别(OCR)带来了显著挑战,迫切需要更高效和更稳健的文本检测解决方案。本文提出了FastTextSpotter框架,将Swin Transformer视觉主干与Transformer Encoder-Decoder架构集成,增强了新型更快的自注意力单元SAC2,以提高处理速度而不牺牲准确性。FastTextSpotter在多个数据集上得到验证,包括ICDAR2015用于常规文本,CTW1500和TotalText用于任意形状文本,与当前最先进模型进行基准测试。我们的结果表明,FastTextSpotter不仅在检测和识别多语言场景文本(英语和越南语)方面实现了卓越的准确性,还提升了模型效率,从而在该领域设立了新的基准。该研究强调了先进Transformer架构在提高文本检测应用在多样化真实环境中的可适应性和速度方面的潜力。该数据集、代码和预训练模型已在我们的Github上发布。
引用
@article{arxiv.2408.14998,
title = {FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text Spotting},
author = {Alloy Das and Sanket Biswas and Umapada Pal and Josep Lladós and Saumik Bhattacharya},
journal= {arXiv preprint arXiv:2408.14998},
year = {2025}
}
备注
Accepted in ICPR 2024