中文

基于上下文驱动的无训练轻量场景文本分割与识别网络

计算机视觉与模式识别 2025-03-21 v1 人工智能

摘要

现代场景文本识别系统通常依赖大型端到端架构,需要大量训练,在实时场景下昂贵且不可行。在这种情况下,受限于内存、计算资源和延迟的部署重型模型变得不实用。为解决这些挑战,我们提出了一种新颖的、无训练即插即用框架,利用预训练文本识别器的优势,同时最小化冗余计算。我们的方法基于上下文理解,引入基于注意力的分割阶段,对候选文本区域进行像素级细化,从而改善下游识别。不进行传统文本检测,而是通过特征图与源图像之间的块级比较并利用预训练captioner获取上下文信息,使框架能够直接从场景上下文生成单词预测。候选文本在语义和词典层面进行评估,以获得最终得分。满足或超过预定义置信度阈值的预测可跳过更重的端到端文本 STR profiling,确保更快的推理并降低不必要的计算。公开基准测试表明,我们的范式在性能上与最先进的系统持平,却需要大幅减少资源。

关键词

引用

@article{arxiv.2503.15639,
  title  = {A Context-Driven Training-Free Network for Lightweight Scene Text Segmentation and Recognition},
  author = {Ritabrata Chakraborty and Shivakumara Palaiahnakote and Umapada Pal and Cheng-Lin Liu},
  journal= {arXiv preprint arXiv:2503.15639},
  year   = {2025}
}