基于高效模型缩放与完形自蒸馏的精确场景文本识别
计算机视觉与模式识别
2025-03-21 v1 人工智能
计算与语言
摘要
缩放架构已被证明能有效提升场景文本识别 (STR),但视觉编码器和文本解码器缩放的单独贡献仍未被充分探索。在本工作中,我们进行了深入的实证分析,并证明与先前的观察相反,缩放解码器可带来显著的性能提升,且始终超过仅缩放编码器所取得的增益。我们还发现标签噪声是 STR 中的一个关键挑战,尤其是在真实世界数据中,它会限制 STR 模型的有效性。为了解决这一问题,我们提出了完形自蒸馏 (CSD),该方法通过从教师模型生成的上下文感知软预测和伪标签中蒸馏学生模型来缓解标签噪声。此外,我们通过为 STR 引入差分交叉注意力来增强解码器架构。我们的方法仅使用真实数据便在 11 个基准测试中的 10 个上取得了 SOTA 性能,同时显著减小了参数规模并降低了计算成本。
引用
@article{arxiv.2503.16184,
title = {Accurate Scene Text Recognition with Efficient Model Scaling and Cloze Self-Distillation},
author = {Andrea Maracani and Savas Ozkan and Sijun Cho and Hyowon Kim and Eunchung Noh and Jeongwon Min and Cho Jung Min and Dookun Park and Mete Ozay},
journal= {arXiv preprint arXiv:2503.16184},
year = {2025}
}