OTSNet:基于神经认知的观察-思考-拼写场景文本识别管线
计算机视觉与模式识别
2025-11-12 v1 人工智能
摘要
场景文本识别(STR)因现实世界复杂性仍具挑战性,现有框架中解耦的视觉-语言优化放大了跨模态错位导致的误差传播。视觉编码器对背景干扰物产生注意力偏差,而解码器在解析几何变形文本时受空间错位影响,整体降低了对不规则图案的识别精度。灵感来自人类视觉感知中的层次认知过程,我们提出OTSNet,这是一条新型三阶段网络,体现神经认知启发的观察-思考-拼写管线,用于统一STR建模。该体系结构包括三个核心组件:(1)双注意力妊娠编码器(DAME),通过差分注意力图细化视觉特征,抑制无关区域并增强判别性聚焦;(2)位置感知模块(PAM)和语义量化器(SQ),联合通过自适应抽样将空间上下文与字形级语义抽象集成;(3)多模态协同验证器(MMCV),通过视觉、语义和字符级特征的跨模态融合实现自我纠错。广泛实验表明,OTSNet实现了最先进的性能,在具有挑战性的Union14M-L基准上达到83.5%的平均准确率,在严重遮挡的OST数据集上达到79.1%——在9个评估情景中建立了新纪录。
引用
@article{arxiv.2511.08133,
title = {OTSNet: A Neurocognitive-Inspired Observation-Thinking-Spelling Pipeline for Scene Text Recognition},
author = {Lixu Sun and Nurmemet Yolwas and Wushour Silamu},
journal= {arXiv preprint arXiv:2511.08133},
year = {2025}
}