面向鲁棒手写文本识别的即时用户参与方法
计算机视觉与模式识别
2022-12-20 v1
摘要
长期 OCR 服务旨在以有竞争力的成本向用户提供高质量输出。由于用户上传的数据复杂,对模型进行升级至关重要。服务提供商会激励那些提供 OCR 模型失败数据的用户,并根据数据复杂度、可读性和可用预算给予奖励。迄今为止,OCR 工作多在标准数据集上准备模型而未考虑终端用户。我们提出一种策略:在 15 名用户的数据集上,对已有的印地语手写 OCR 模型进行三次持续升级。每次迭代固定 4 名用户的预算。第一次迭代中,模型直接在最初四名用户的数据集上训练。在后续迭代中,其余每名用户各写一页,由服务提供商分析并基于人类可读词上的预测质量选出 4 名(新)最佳用户。被选中的用户再写 23 页以升级模型。我们利用课程学习(CL)在当前迭代可用数据上升级模型,并与之前迭代的子集进行比较。升级后的模型在所有 23 名用户每人一页的保留集上测试。我们深入分析了 CL、用户选择尤其是未见书写风格数据的影响。我们的工作可用于众包场景下服务提供商与终端用户的长期 OCR 服务。
引用
@article{arxiv.2212.08834,
title = {Towards Robust Handwritten Text Recognition with On-the-fly User Participation},
author = {Ajoy Mondal and Rohit saluja and C. V. Jawahar},
journal= {arXiv preprint arXiv:2212.08834},
year = {2022}
}