AfriEconQA:基于世界银行报告的非洲经济分析基准数据集
计算与语言
2026-01-26 v2
摘要
我们引入了 AfriEconQA,一个专门用于非洲经济分析的基准数据集,该数据集基于包含 236 份世界银行报告的综合语料库构建。AfriEconQA 的任务是回答复杂的经济学问题,这些问题要求从专业机构文档中进行高精度的数值推理和时间消歧。该数据集包含 8,937 个精心筛选的问答实例,这些实例从 10018 个合成问题池中经过严格过滤,以确保高质量的证据-答案对齐。每个实例由以下部分组成:(1) 需要对经济指标进行推理的问题,(2) 从语料库中检索到的相应证据,(3) 经验证的真实答案,以及 (4) 确保时间溯源的来源元数据(如 URL 和发布日期)。AfriEconQA 是首个专门针对非洲经济分析的基准测试,为信息检索 (IR) 系统提供了独特的挑战,因为这些数据在很大程度上不存在于当前大型语言模型 (LLMs) 的预训练语料库中。我们通过一个 11 实验矩阵将该数据集投入实际应用,在五种不同的嵌入和排序策略下,将零样本基线 (GPT-5 Mini) 与使用 GPT-4o 和 Qwen 32B 的 RAG 配置进行了基准对比。我们的结果表明存在严重的参数化知识鸿沟,零样本模型无法回答超过 90% 的查询,即使是最先进的 RAG 流水线也难以实现高精度。这证实了 AfriEconQA 是面向下一代特定领域 IR 和 RAG 系统的稳健且具有挑战性的基准测试。AfriEconQA 数据集和代码将在发表后公开提供。
引用
@article{arxiv.2601.15297,
title = {AfriEconQA: A Benchmark Dataset for African Economic Analysis based on World Bank Reports},
author = {Edward Ajayi},
journal= {arXiv preprint arXiv:2601.15297},
year = {2026}
}