检索增强结构化生成:作为工具使用的商业文档信息抽取
计算与语言
2024-05-31 v1 人工智能
信息检索
机器学习
摘要
商业文档信息抽取 (BDIE) 是将非结构化信息块(原始文本、扫描文档等)转换为下游系统可以解析和使用的结构化格式的问题。它有两个主要任务:关键信息抽取 (KIE) 和行项目识别 (LIR)。在本文中,我们认为 BDIE 最好被建模为一个工具使用问题,其中工具就是这些下游系统。然后,我们提出了检索增强结构化生成 (RASG),这是一个新颖的通用 BDIE 框架,在 BDIE 基准测试的 KIE 和 LIR 任务上都取得了最先进 (SOTA) 的结果。本文的贡献有三方面:(1) 我们通过消融基准测试表明,在 BDIE 基准测试上,使用 RASG 的大型语言模型 (LLMs) 已经与当前未使用 RASG 的最先进大型多模态模型 (LMMs) 具有竞争力或超越它们。(2) 我们为行项目识别提出了一种新的度量类别,即通用行项目识别度量 (GLIRM),与现有度量(如 ANLS*、DocILE 和 GriTS)相比,它更符合实际的 BDIE 用例。(3) 我们提供了一种启发式算法,用于反向计算预测行项目和表格的边界框,而无需视觉编码器。最后,我们声称,虽然 LMMs 有时可能提供边际性能优势,但考虑到 BDIE 的实际应用和约束,LLMs + RASG 通常更优越。
引用
@article{arxiv.2405.20245,
title = {Retrieval Augmented Structured Generation: Business Document Information Extraction As Tool Use},
author = {Franz Louis Cesista and Rui Aguiar and Jason Kim and Paolo Acilo},
journal= {arXiv preprint arXiv:2405.20245},
year = {2024}
}
备注
Accepted by IEEE 7th International Conference on Multimedia Information Processing and Retrieval (MIPR), 2024