中文

暗光下的文本识别:算法与基准

计算机视觉与模式识别 2024-04-25 v3 多媒体

摘要

在低光环境下定位文本由于视觉退化而具有挑战性。尽管直接的解决方案涉及一个两阶段流程,即先进行低光图像增强(LLE)再使用检测器,但LLE主要针对人类视觉而非机器设计,且可能累积误差。在这项工作中,我们提出了一种高效且有效的单阶段方法,用于在暗光下定位文本,从而避免了LLE的需求。我们在文本检测器的训练阶段引入了一个约束学习模块作为辅助机制。该模块旨在引导文本检测器在特征图缩放过程中保留文本空间特征,从而最小化低光视觉退化下文本空间信息的损失。具体来说,我们在该模块中加入了空间重建和空间语义约束,以确保文本检测器获取必要的位置和上下文范围知识。我们的方法通过动态蛇形特征金字塔网络增强了原始文本检测器识别文本局部拓扑特征的能力,并采用自底向上的轮廓塑造策略以及新颖的矩形累积技术,以精确描绘流线型文本特征。此外,我们提供了一个全面的低光任意形状文本数据集,涵盖多种场景和语言。值得注意的是,我们的方法在该低光数据集上取得了最先进的结果,并在标准正常光数据集上表现出可比的性能。代码和数据集将发布。

关键词

引用

@article{arxiv.2404.08965,
  title  = {Seeing Text in the Dark: Algorithm and Benchmark},
  author = {Chengpei Xu and Hao Fu and Long Ma and Wenjing Jia and Chengqi Zhang and Feng Xia and Xiaoyu Ai and Binghao Li and Wenjie Zhang},
  journal= {arXiv preprint arXiv:2404.08965},
  year   = {2024}
}