中文

基于自适应增强的多域零售账单 OCR 流水线基准测试

计算机视觉与模式识别 2026-04-29 v1 机器学习

摘要

多域零售账单的数字化由于扫描质量的变异性、布局的异质性以及商业部门之间的领域多样性,仍是一个具有挑战性的任务。本文提出并基准测试了一个智能、质量感知的自适应光学字符识别 (OCR) 流水线,用于跨五个领域的零售账单数字化:超市、餐厅、五金店、鞋类零售店和服装零售店。该系统集成了一个基于卷积神经网络 (CNN) 的图像增强模块,通过自监督去噪进行训练,采用三层路由的拉普拉斯方差图像质量分析器,结合置信度驱动的自适应反馈循环进行迭代重试,以及基于 NLP 的后 OCR 校正层。对 360 张异构零售账单图像进行了实验。用于定量评估的 ground truth 采用 OCR 集团多数投票策略生成,这是一种在无手动标注情境下已验证的做法。该提出的流水线实现了字符错误率 (CER) 为 18.4% 和词错误率 (WER) 为 27.6%,分别相对于 Raw Tesseract 基线提高了 26.4% 和 31.2%。该流水线还实现了每张图像 108.3 词的文本密度、2.3% 的噪声比率以及每张图像 3.64 秒的处理时间——比 EasyOCR 快 6.4 倍。对增强后 MEDIUM 和 LOW 质量图像的 PSNR 分析平均为 28.7 dB,确认了有意义的增强。这些结果为多域零售账单 OCR 研究建立了一个可复现的基准。

关键词

引用

@article{arxiv.2604.25176,
  title  = {Benchmarking OCR Pipelines with Adaptive Enhancement for Multi-Domain Retail Bill Digitization},
  author = {Vijaysinh Gaikwad},
  journal= {arXiv preprint arXiv:2604.25176},
  year   = {2026}
}