地标与区域:一种鲁棒的数据抽取方法
软件工程
2022-04-12 v1 信息检索
编程语言
摘要
我们提出一种从半结构化文档中抽取数据项或字段值的新方法。此类问题的例子包括从行程单中抽取乘客姓名、出发时间和出发机场,或从购买收据中抽取商品价格。传统的数据抽取方法使用机器学习或程序合成来处理整个文档以抽取所需字段。这类方法对文档格式变化不鲁棒,即便文档中发生了与所需目标字段无关部分的改动,抽取过程通常也会失败。我们提出一种基于地标与区域概念的数据抽取新方法。人类在手动处理文档时 routinely 使用地标来放大并聚焦于文档中小的感兴趣区域。受此人类直觉启发,我们在程序合成中使用地标概念,自动合成抽取程序:先抽取小的感兴趣区域,随后在下一步中从该区域自动抽取所需值。我们已在工具LRSyn中实现了基于地标的抽取方法,并对HTML文档以及发票和收据的扫描图像进行了广泛评估。结果表明,我们的方法对真实场景中 routinely 发生的各类格式变化具有鲁棒性。
引用
@article{arxiv.2204.05021,
title = {Landmarks and Regions: A Robust Approach to Data Extraction},
author = {Suresh Parthasarathy and Lincy Pattanaik and Anirudh Khatry and Arun Iyer and Arjun Radhakrishna and Sriram Rajamani and Mohammad Raza},
journal= {arXiv preprint arXiv:2204.05021},
year = {2022}
}
备注
To be published at PLDI,2022