一种面向富视觉文档的数据增强策略
计算与语言
2022-12-23 v2
摘要
许多业务流程需要从表单类文档(例如银行对账单、提单、采购订单等)中提取重要字段。近期用于自动化该任务的技术仅在以大规模数据集训练时表现良好。在本工作中,我们提出一种新颖的数据增强技术,以在训练数据稀缺(例如 10-250 份文档)时提升性能。我们的技术称为 FieldSwap,其通过将源字段的关键短语与目标字段的关键短语进行交换,生成目标字段的新合成样本用于训练。我们证明该方法可带来 1-7 个 F1 点的抽取性能提升。
引用
@article{arxiv.2212.10047,
title = {An Augmentation Strategy for Visually Rich Documents},
author = {Jing Xie and James B. Wendt and Yichao Zhou and Seth Ebner and Sandeep Tata},
journal= {arXiv preprint arXiv:2212.10047},
year = {2022}
}
备注
9 pages, 6 figures, 3 tables