基于级联 Transformer 的高效精准场景文本识别
计算机视觉与模式识别
2025-03-25 v1
摘要
近年来,带有文本解码器的视觉 Transformer 在 Scene Text Recognition(STR)中因其捕捉长程依赖和上下文关系的高学习容量而表现突出。然而,这些模型的计算和内存需求较大,限制了其在资源受限应用中的部署。为此,我们提出一种高效精准的 STR 系统。具体而言,我们聚焦于通过引入级联 Transformer 结构来提高编码器的效率。该结构在编码过程中逐步减小视觉 token 大小,有效消除冗余 token,降低计算成本。我们的实验结果表明,our STR 系统在保持相当于最新基线的性能的同时,显著降低了计算需求。特别地,对于大型模型,准确率保持不变,92.77 至 92.68,而计算复杂度几乎减半。
引用
@article{arxiv.2503.18883,
title = {Efficient and Accurate Scene Text Recognition with Cascaded-Transformers},
author = {Savas Ozkan and Andrea Maracani and Hyowon Kim and Sijun Cho and Eunchung Noh and Jeongwon Min and Jung Min Cho and Mete Ozay},
journal= {arXiv preprint arXiv:2503.18883},
year = {2025}
}
备注
Accepted to ACM-MMSys2025