pdfQA:基于 PDF 的多样化、具挑战性且符合现实情境的问答
计算与语言
2026-01-07 v2 人工智能
摘要
PDF 是互联网上使用排名第二的文件类型(后于 HTML).然而,现有 QA 数据集通常从文本来源开始,或仅针对特定领域进行处理.本文提出 pdfQA,一个由 2K 人工标注( real-pdfQA)和 2K 人工合成(real-pdfQA)数据集构成,区分问答对包含十个复杂度维度(如文件类型、来源模态、来源位置、答案类型等).我们对两套数据集应用并评估了质量和难度过滤器,获得有效且具挑战性的问答对.我们使用开源大语言模型回答问题,揭示了与复杂度维度相关的现有挑战. pdfQA 为端到端 QA 流水线评估提供了基础,可测试多样化技能集和局部优化(如信息检索或解析).
引用
@article{arxiv.2601.02285,
title = {pdfQA: Diverse, Challenging, and Realistic Question Answering over PDFs},
author = {Tobias Schimanski and Imene Kolli and Yu Fan and Ario Saeid Vaghefi and Jingwei Ni and Elliott Ash and Markus Leippold},
journal= {arXiv preprint arXiv:2601.02285},
year = {2026}
}