中文

PDFTriage:面向长结构化文档的问答方法

计算与语言 2023-11-09 v2 人工智能 机器学习

摘要

大型语言模型(LLMs)在文档问答(QA)中存在问题,即当文档无法放入 LLM 较小的上下文长度时表现不佳。为克服该问题,大多数现有工作聚焦于从文档中检索相关上下文,并将其表示为纯文本。然而,诸如 PDF、网页和演示文稿等文档天然具有页面、表格、章节等不同的结构。将此类结构化文档表示为纯文本,与用户对这些具有丰富结构文档的心智模型不符。当系统必须查询文档以获取上下文时,这种不协调便凸显出来,看似简单的问题也可能难倒问答系统。为弥合处理结构化文档时的这一根本性差距,我们提出一种称为 PDFTriage 的方法,使模型能够基于结构或内容检索上下文。我们的实验证明了所提出的 PDFTriage 增强模型在现有检索增强 LLM 失效的多类问题上的有效性。为促进针对这一基本问题的进一步研究,我们发布了基准数据集,包含来自 10 种不同问题类型的 80 个结构化文档上由人工生成的 900+ 个问题,用于文档 QA。我们的代码和数据集将很快在 Github 上发布。

关键词

引用

@article{arxiv.2309.08872,
  title  = {PDFTriage: Question Answering over Long, Structured Documents},
  author = {Jon Saad-Falcon and Joe Barrow and Alexa Siu and Ani Nenkova and David Seunghyun Yoon and Ryan A. Rossi and Franck Dernoncourt},
  journal= {arXiv preprint arXiv:2309.08872},
  year   = {2023}
}