中文

AMuRD:用于关键信息抽取与分类的标注阿拉伯语-英语收据数据集

计算与语言 2024-03-27 v3

摘要

从收据中抽取关键信息是一项复杂任务,涉及对扫描收据中文本的识别与抽取。该过程至关重要,因为它能够检索重要内容并将其组织为结构化文档,以便于访问和分析。本文提出 AMuRD,一个专为收据信息抽取设计的新型多语言人工标注数据集。该数据集包含 47,72047,720 个样本,解决了信息抽取与物品分类——零售业数据分析的两个关键方面——中的主要挑战。每个样本均包含物品名称及价格、品牌等属性的标注。这种细致标注有助于全面理解收据上每一物品。此外,该数据集提供分为 4444 个不同产品类别的标注。该分类特性使物品分析更为有序高效,提升了数据集在各种应用中的可用性。在我们的研究中,评估了多种语言模型架构,例如在 AMuRD 数据集上微调 LLaMA 模型。我们的方法取得了优异结果:在信息抽取与分类中 F1 分数为 97.43%、准确率为 94.99%,在特定任务中观测到更高的 F1 分数 98.51% 与准确率 97.06%。数据集与代码已公开供进一步研究 https://github.com/Update-For-Integrated-Business-AI/AMuRD。

关键词

引用

@article{arxiv.2309.09800,
  title  = {AMuRD: Annotated Arabic-English Receipt Dataset for Key Information Extraction and Classification},
  author = {Abdelrahman Abdallah and Mahmoud Abdalla and Mohamed Elkasaby and Yasser Elbendary and Adam Jatowt},
  journal= {arXiv preprint arXiv:2309.09800},
  year   = {2024}
}