TiCLS:紧密耦合语言文本探测器
计算机视觉与模式识别
2026-02-05 v1
摘要
场景文本检测与识别旨在从真实图像中检测并识别文本,其中实例常为短小、碎片化或视觉上模糊。现有方法主要依赖视觉线索,隐式捕获局部字符依赖,但忽视了外部语言知识的益处。先前尝试整合语言模型的方法,要么是在无外部知识的情况下适应语言建模目标,要么应用的预训练模型与场景文本的词级粒度不匹配。我们提出TiCLS,一个显式整合来自字符级预训练语言模型的外部语言知识的端到端文本探测器。TiCLS引入了语言解码器,用于融合视觉与语言特征,同时可以由预训练语言模型初始化,从而实现对模糊或碎片化文本的稳健识别。在ICDAR 2015和Total-Text数据集上进行的实验表明,TiCLS实现了最先进的性能,验证了预训练语言模型引导的语言集成对场景文本检测识别的有效性。
引用
@article{arxiv.2602.04030,
title = {TiCLS : Tightly Coupled Language Text Spotter},
author = {Leeje Jang and Yijun Lin and Yao-Yi Chiang and Jerod Weinman},
journal= {arXiv preprint arXiv:2602.04030},
year = {2026}
}