在黑暗中阅读:低光场景文本识别
计算机视觉与模式识别
2026-04-28 v1
摘要
在低光环境下进行精准文本识别,是智能系统在自动驾驶、智能监控等应用中的关键需求。然而,如何应对照度不足和噪声干扰等挑战仍有待深入探讨。为此,我们引入LSTR—a大型低光场景文本识别数据集,包含11,273张低光图像,由ICDAR2015、IIIT5K和WordArt等亮度良好的数据集生成;同时构建ESTR数据集,包含60张仅用于英文和西班牙文夜间街景图像的评估。我们探讨两种解决方案:(1)采用OCR模型进行微调或基于LoRA的微调;(2)联合训练策略,将低光图像增强(LLIE)模块与OCR模型集成。尤其,我们提出了新颖的重渲染低光图像增强(RLLIE)模块,在真实场景数据上表现出优异性能。通过大量实验,我们分析了 various训练策略,回答了核心问题:\emph{有效场景文本识别需要多亮?}我们的实验表明,单独的LLIE或OCR模型在低光条件下表现不足,凸显了专业化、联合训练的文本导向方法的优势。此外,我们提供了全面的基准测试,以支持未来在鲁棒低光场景文本识别方面的研究。https://huggingface.co/datasets/lumimusta/Low-light_Scene_Text_Dataset
引用
@article{arxiv.2604.23685,
title = {Reading in the Dark: Low-light Scene Text Recognition},
author = {Xuanshuo Fu and Lei Kang and Ernest Valveny and Dimosthenis Karatzas and Javier Vazquez-Corral},
journal= {arXiv preprint arXiv:2604.23685},
year = {2026}
}