联合抽取更重要:基于提示的多字段文档信息抽取视觉问答
计算与语言
2025-03-24 v1 计算机视觉与模式识别
摘要
视觉问答(VQA)已成为从文档图像中抽取特定信息的灵活方法。然而,现有工作通常以孤立方式查询文档中的每个字段,忽略了跨多个项目之间的潜在依赖性。本文我们探讨了同时抽取多个字段与单独抽取的优势。通过在多个大型视觉语言模型和数据集上进行实验,我们表明联合抽取字段通常能提高准确率,尤其是在字段之间存在强烈的数值或上下文依赖性时。我们进一步分析了性能随请求项目数量的扩展情况,并使用基于回归的指标量化字段间关系。我们的结果表明,多字段提示可减轻由相似表面形式和相关数值引起的混淆,为在文档信息抽取任务中设计稳健的VQA系统提供了实用方法。
引用
@article{arxiv.2503.16868,
title = {Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction},
author = {Mengsay Loem and Taiju Hosaka},
journal= {arXiv preprint arXiv:2503.16868},
year = {2025}
}