OCR-IDL:工业文档库数据集的OCR标注
计算机视觉与模式识别
2022-03-01 v1 人工智能
摘要
预训练已在文档智能任务中被证明是成功的,其中大量文档被用于预训练模型,随后在下游任务上微调。预训练方法的问题之一是不同OCR引擎对预训练数据的不一致使用,导致模型间结果不可比。换言之,性能提升究竟来自数据量与不同OCR引擎的多样使用,还是来自所提出的模型,并不明确。为弥补该问题,我们使用商用OCR引擎(因其优于开源OCR模型)公开了IDL文档的OCR标注。所贡献的数据集(OCR-IDL)预估货币价值超过2万美金。我们希望OCR-IDL能成为文档智能未来工作的起点。我们的所有数据及其带标注的采集过程可在 https://github.com/furkanbiten/idl_data 找到。
引用
@article{arxiv.2202.12985,
title = {OCR-IDL: OCR Annotations for Industry Document Library Dataset},
author = {Ali Furkan Biten and Rubèn Tito and Lluis Gomez and Ernest Valveny and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2202.12985},
year = {2022}
}