中文

EventSTR:基于事件流的场景文本识别基准数据集与基线

计算机视觉与模式识别 2025-02-14 v1 人工智能

摘要

主流的场景文本识别 (STR) 算法基于 RGB 摄像头开发,RGB 摄像头对低光照、运动模糊和杂乱背景等挑战因素敏感。本文提出使用生物仿生事件相机进行场景文本识别,通过收集和标注一个大规模基准数据集,称为 EventSTR。该数据集包含 9,928 个高清 (1280 * 720) 事件样本,涉及中英文字符。我们还将多个 STR 算法作为基线供未来工作比较。此外,我们提出了新的基于事件的场景文本识别框架,称为 SimC-ESTR。它首先使用视觉编码器提取事件特征,并通过 Q-former 模块将其投影到 token。更重要的是,我们在记忆机制基础上增强视觉 token,以便输入到大型语言模型中。我们嵌入基于相似性的纠错机制于大型语言模型中,以基于上下文信息根本性地纠正潜在的轻微错误。在新提出的 EventSTR 数据集和两个模拟 STR 数据集上的大量实验充分展示了我们所提出模型的有效性。我们相信该数据集和算法模型能够创造性地提出一种基于事件的 STR 任务,并有望加速事件相机在各行业的应用。源代码和预训练模型将在 https://github.com/Event-AHU/EventSTR 上发布。

关键词

引用

@article{arxiv.2502.09020,
  title  = {EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition},
  author = {Xiao Wang and Jingtao Jiang and Dong Li and Futian Wang and Lin Zhu and Yaowei Wang and Yongyong Tian and Jin Tang},
  journal= {arXiv preprint arXiv:2502.09020},
  year   = {2025}
}

备注

In Peer Review