多模态上下文学习造就自我演进的场景文本识别器
计算机视觉与模式识别
2024-03-29 v3
摘要
野外场景文本识别 (STR) 在应对领域变化、字体多样性、形状变形等时常遭遇挑战。一个直接的解决方案是面向特定场景进行模型微调,但其计算密集且需为不同场景保留多个模型副本。近期研究表明大语言模型 (LLMs) 能以免训练方式从少量示范样例学习,称为“上下文学习” (ICL)。然而,将 LLMs 用作文本识别器资源消耗令人难以接受。此外,我们对 LLMs 的初步实验显示 ICL 在 STR 中失效,主要归因于训练阶段对多样样例上下文信息融合不足。为此,我们引入 ESTR,一种以富含上下文的场景文本序列训练的 STR 模型,其中序列通过我们提出的上下文训练策略生成。ESTR 证明常规尺寸模型足以在 STR 中获得有效 ICL 能力。大量实验表明 ESTR 在各场景展现出显著的免训练适配能力,并在公开基准上超越甚至微调过的最先进方法。代码发布于 https://github.com/bytedance/E2STR 。
引用
@article{arxiv.2311.13120,
title = {Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer},
author = {Zhen Zhao and Jingqun Tang and Chunhui Lin and Binghong Wu and Can Huang and Hao Liu and Xin Tan and Zhizhong Zhang and Yuan Xie},
journal= {arXiv preprint arXiv:2311.13120},
year = {2024}
}
备注
Accepted to CVPR2024