中文

一种面向富视觉文档的数据增强策略

计算与语言 2022-12-23 v2

摘要

许多业务流程需要从表单类文档(例如银行对账单、提单、采购订单等)中提取重要字段。近期用于自动化该任务的技术仅在以大规模数据集训练时表现良好。在本工作中,我们提出一种新颖的数据增强技术,以在训练数据稀缺(例如 10-250 份文档)时提升性能。我们的技术称为 FieldSwap,其通过将源字段的关键短语与目标字段的关键短语进行交换,生成目标字段的新合成样本用于训练。我们证明该方法可带来 1-7 个 F1 点的抽取性能提升。

关键词

引用

@article{arxiv.2212.10047,
  title  = {An Augmentation Strategy for Visually Rich Documents},
  author = {Jing Xie and James B. Wendt and Yichao Zhou and Seth Ebner and Sandeep Tata},
  journal= {arXiv preprint arXiv:2212.10047},
  year   = {2022}
}

备注

9 pages, 6 figures, 3 tables