中文

VRDSynth:面向多语言视觉丰富文档信息提取的程序合成

人工智能 2024-07-10 v1

摘要

企业需要查询视觉丰富文档(VRD),如收据、医疗记录和保险表格,以做出决策。现有的从VRD中提取实体的技术难以处理新的布局,或者需要大量的预训练数据。我们引入了VRDSynth,一种无需预训练数据即可自动从多语言VRD中提取实体关系的程序合成方法。为了捕捉VRD领域的复杂性,我们设计了一种领域特定语言(DSL)来捕捉空间和文本关系,以描述合成的程序。与此同时,我们还推导出一种新的合成算法,利用频繁空间关系、搜索空间剪枝以及正例、负例和排他性程序的组合来提高覆盖率。我们在FUNSD和XFUND基准测试上评估了VRDSynth的语义实体链接任务,这些基准测试包含8种语言的1,592份表单。VRDSynth在8种语言中的5种、6种和7种上分别优于最先进的预训练模型(LayoutXLM、InfoXLMBase和XLMRobertaBase),在英语中F1分数比LayoutXLM提高了42%。为了测试模型的可扩展性,我们通过自动表格识别进一步改进了VRDSynth,创建了VRDSynth(Table),并将其与预训练模型的扩展版本InfoXLM(Large)和XLMRoberta(Large)进行比较。VRDSynth(Table)在8种语言中的4种以及平均F1分数上优于这些基线。VRDSynth还显著减少了内存占用(1M和380MB对比LayoutXLM的1.48GB和3GB),同时保持了相似的时间效率。

关键词

引用

@article{arxiv.2407.06826,
  title  = {VRDSynth: Synthesizing Programs for Multilingual Visually Rich Document Information Extraction},
  author = {Thanh-Dat Nguyen and Tung Do-Viet and Hung Nguyen-Duy and Tuan-Hai Luu and Hung Le and Bach Le and Patanamon and Thongtanunam},
  journal= {arXiv preprint arXiv:2407.06826},
  year   = {2024}
}

备注

Accepted in ISSTA'24