DeeperDive:弱监督在文档理解中出乎意料的有效性——与 UiPath 公司合作的案例研究
计算与语言
2022-08-18 v1
摘要
近年来,弱监督已应用于多种自然语言理解任务。由于将弱监督扩展至长达数百页的长文档存在技术挑战,其在文档理解领域的应用受到限制。在 Lexion,我们构建了专为长格式(10–200 页)PDF 文档定制的基于弱监督的系统。我们利用该平台构建了数十个语言理解模型,并成功应用于从商业协议到公司成立文件的各种领域。本文中,我们展示了在有限时间、人力和训练数据情形下,利用弱监督进行监督学习的有效性。我们在一周内构建了 8 个高质量机器学习模型,仅由 3 名标注员组成的小团队借助少于 300 篇文档的数据集完成。我们分享了关于整体架构、如何利用弱监督以及所能达成结果的一些细节。我们亦包含该数据集以供希望尝试替代方法或改进我们的方法的研究者使用。此外,我们阐明了处理 PDF 格式下扫描质量差的长文档时所出现的额外复杂性,以及帮助我们在此类数据上取得 SOTA 性能的一些技术。
引用
@article{arxiv.2208.08000,
title = {DeeperDive: The Unreasonable Effectiveness of Weak Supervision in Document Understanding A Case Study in Collaboration with UiPath Inc},
author = {Emad Elwany and Allison Hegel and Marina Shah and Brendan Roof and Genevieve Peaslee and Quentin Rivet},
journal= {arXiv preprint arXiv:2208.08000},
year = {2022}
}