中文

细调与长尾问题:场景文本检测新基准

计算机视觉与模式识别 2025-05-22 v1

摘要

场景文本检测领域涌现出高性能的方法,在学术基准上表现卓越。然而,这些检测器往往难以在现实场景中复制此类成功。通过大量实验,我们发现导致这一差异的两个关键因素。首先,存在“微调差距”(Fine-tuning Gap),即模型在一个领域内利用数据特定优化(Dataset-Specific Optimization, DSO)范式,牺牲了对其他领域的有效性,导致在学术基准上获得夸张的性能。其次,现实环境下的次优性能主要归因于文本的长尾分布,检测器在处理稀有且复杂的类别(如艺术文本或重叠文本)时常常力不从心。鉴于 DSO 范式可能削弱模型的泛化能力,我们主张采用“联合数据学习”(Joint-Dataset Learning, JDL)协议以缓解微调差距。此外,我们进行了错误分析,识别出三大类别和十三个子类别的长尾场景文本挑战,基于此提出了长尾基准(Long-Tailed Benchmark, LTB)。LTB 促进对处理多样化长尾挑战能力的全面评估。我们进一步引入 MAEDet,一种基于自监督学习的方法,作为 LTB 的强基准。代码已公开于 https://github.com/pd162/LTB。

关键词

引用

@article{arxiv.2505.15649,
  title  = {The Devil is in Fine-tuning and Long-tailed Problems:A New Benchmark for Scene Text Detection},
  author = {Tianjiao Cao and Jiahao Lyu and Weichao Zeng and Weimin Mu and Yu Zhou},
  journal= {arXiv preprint arXiv:2505.15649},
  year   = {2025}
}

备注

Accepted by IJCAI2025