EIGEN:用于文档图像高保真信息抽取的行家指导联合学习聚合方法
计算机视觉与模式识别
2023-11-27 v1
摘要
由于版式格式的高度多变性,从文档图像中进行信息抽取(IE)具有挑战性。诸如 LayoutLM 和 BROS 等深度模型已被提出以解决此问题并展现出有前景的结果。然而,它们仍需要大量字段级标注来训练这些模型。其他使用基于规则的方法也已被提出,其建立在对表单版式与语义(如几何位置或字段类型等)的理解之上。在本工作中,我们提出一种新方法 EIGEN(Expert-Informed Joint Learning aGgrEatioN,行家指导联合学习聚合),它利用数据编程方法将基于规则的方法与深度学习模型相结合,从而规避对大量训练数据标注的需求。具体而言,EIGEN 通过生成模型整合由多种启发式规则导出的弱标签,并将其与少量标注标签一起用于联合训练深度模型。在我们的框架中,我们提出使用包含上下文信息的标注函数,从而捕捉词的视觉与语言上下文以实现准确分类。我们通过实验表明,在仅有极少标注数据实例的情况下,我们的 EIGEN 框架能显著提升最先进深度模型的性能。源代码见 https://github.com/ayushayush591/EIGEN-High-Fidelity-Extraction-Document-Images。
引用
@article{arxiv.2311.13993,
title = {EIGEN: Expert-Informed Joint Learning Aggregation for High-Fidelity Information Extraction from Document Images},
author = {Abhishek Singh and Venkatapathy Subramanian and Ayush Maheshwari and Pradeep Narayan and Devi Prasad Shetty and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2311.13993},
year = {2023}
}
备注
In Proceedings of ML for Health Conference, 2023 (co-located with Neurips)