CER-HV:应用于阿拉伯文手写文字识别的人类在环数据清洁框架
计算机视觉与模式识别
2026-02-25 v3
摘要
尽管近期在模型架构、数据集和基准方面取得了进展,阿拉伯脚本语言的手写文字识别(HTR)仍滞后于拉丁脚本HTR。我们指出,数据质量是许多已发布数据集的重要限制因素,并提出CER-HV(CER-based Ranking with Human Verification,基于CER的排名与人类验证)作为检测和清洁标签错误的框架。CER-HV结合了基于CER的噪声检测器,采用精心配置的卷积循环神经网络(CRNN),并使用提前停止以避免对噪声样本过拟合,同时包含人类在环(HITL)步骤以验证高排名样本。该框架揭示了多个现有数据集包含先前未报告的问题,包括转录、分段、方向和非文本内容错误。这些问题在Muharaf数据集中的精度可达90%,在PHTI数据集中的精度为80-86%。我们还展示了我们的CRNN在六个评估数据集中实现最先进性能,达到KHATT(阿拉伯文)8.45%字符错误率(CER)、PHTI(普什图文)8.26%、Ajami 10.66%和Muharaf(阿拉伯文)10.11%,且无需任何数据清洁。在PHTD(波斯文)数据集上,我们建立了11.3% CER的新基线。应用CER-HV后,干净数据集上的评估CER改善了0.3-0.6个百分点,噪声较大的数据集上改善了1.0-1.8个百分点。虽然我们的实验聚焦于阿拉伯脚本语言的文档,包括阿拉伯文、波斯文、乌尔都语、Ajami和普什图文,但该框架是通用的,可应用于其他文本识别数据集。
引用
@article{arxiv.2601.16713,
title = {CER-HV: A Human-in-the-Loop Framework for Cleaning Datasets Applied to Arabic-Script HTR},
author = {Sana Al-azzawi and Elisa Barney and Marcus Liwicki},
journal= {arXiv preprint arXiv:2601.16713},
year = {2026}
}