中文

联合抽取更重要:基于提示的多字段文档信息抽取视觉问答

计算与语言 2025-03-24 v1 计算机视觉与模式识别

摘要

视觉问答(VQA)已成为从文档图像中抽取特定信息的灵活方法。然而,现有工作通常以孤立方式查询文档中的每个字段,忽略了跨多个项目之间的潜在依赖性。本文我们探讨了同时抽取多个字段与单独抽取的优势。通过在多个大型视觉语言模型和数据集上进行实验,我们表明联合抽取字段通常能提高准确率,尤其是在字段之间存在强烈的数值或上下文依赖性时。我们进一步分析了性能随请求项目数量的扩展情况,并使用基于回归的指标量化字段间关系。我们的结果表明,多字段提示可减轻由相似表面形式和相关数值引起的混淆,为在文档信息抽取任务中设计稳健的VQA系统提供了实用方法。

关键词

引用

@article{arxiv.2503.16868,
  title  = {Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction},
  author = {Mengsay Loem and Taiju Hosaka},
  journal= {arXiv preprint arXiv:2503.16868},
  year   = {2025}
}