中文

用于快速高效场景文本识别的视觉 Transformer

计算机视觉与模式识别 2021-05-19 v1

摘要

场景文本识别(STR)使计算机能读取自然场景中的文本,如物体标签、路标和说明。STR 帮助机器做出知情决策,如拾取何物、向何方向行进以及下一步动作是什么。在 STR 的研究工作中,焦点始终在识别精度上。很少强调速度和计算效率,而它们同样重要,尤其对能量受限的移动机器。本文我们提出 ViTSTR,一种基于计算与参数高效的视觉 Transformer (ViT) 构建的简洁单阶段模型架构 STR。在如 TRBA 这样精度为 84.3% 的强基线方法上,我们的小模型 ViTSTR 以 2.4 倍加速、仅用 43.4% 参数数量和 42.2% FLOPS 取得了 82.6%(数据增强下 84.2%)的竞争力精度。ViTSTR 的微小版本以 2.5 倍速度、仅需 10.9% 参数数量和 11.9% FLOPS 取得 80.3% 精度(数据增强下 82.1%)。借助数据增强,我们的基础 ViTSTR 以 85.2% 精度(无增强下 83.7%)在 2.3 倍速度下优于 TRBA,但需多 73.2% 参数和 61.5% FLOPS。在权衡方面,几乎所有 ViTSTR 配置都位于或接近同时最大化精度、速度和计算效率的前沿。

关键词

引用

@article{arxiv.2105.08582,
  title  = {Vision Transformer for Fast and Efficient Scene Text Recognition},
  author = {Rowel Atienza},
  journal= {arXiv preprint arXiv:2105.08582},
  year   = {2021}
}

备注

To appear at ICDAR2021 Springer Lecture Notes in Computer Science series