最优框:通过强化学习调整标注边界框以提升端到端场景文本识别
计算机视觉与模式识别
2022-07-27 v2
摘要
文本检测与识别是现代 OCR 系统的基本组成部分。大多数 OCR 方法试图在检测阶段获取准确的文本边界框,并将其作为文本识别阶段的输入。我们观察到,当使用紧凑文本边界框作为输入时,由于边界框与文本识别的深度表示之间不一致,文本识别器经常无法达到最优性能。本文提出 Box Adjuster,一种基于强化学习的方法,用于调整每个文本边界框的形状,使其与文本识别模型更兼容。此外,在处理合成到真实等跨域问题时,所提方法显著减少了源域与目标域之间的域分布失配。实验表明,使用调整后的边界框作为训练真值可提升端到端文本识别系统的性能。具体而言,在多个场景文本理解基准数据集上,所提方法在端到端文本识别任务上以平均 2.0% F-Score 优于当前最优文本定位器,在域自适应任务上以平均 4.6% F-Score 优于当前最优文本定位器。
引用
@article{arxiv.2207.11934,
title = {Optimal Boxes: Boosting End-to-End Scene Text Recognition by Adjusting Annotated Bounding Boxes via Reinforcement Learning},
author = {Jingqun Tang and Wenming Qian and Luchuan Song and Xiena Dong and Lan Li and Xiang Bai},
journal= {arXiv preprint arXiv:2207.11934},
year = {2022}
}
备注
Accepted by ECCV 2022