RelationalFactQA:评估大型语言模型表格事实检索的基准
计算与语言
2025-05-28 v1 人工智能
数据库
摘要
大型语言模型的事实性是一个持续的挑战。当前的基准通常评估简短的事实性答案,而忽略了从参数化知识中生成结构化、多记录表格输出的关键能力。我们证明,即使模型知道单个事实,这种关系事实检索也比孤立的逐点查询困难得多,暴露了对输出维度(例如,属性或记录的数量)敏感的独特失败模式。为了系统地评估这种探索不足的能力,我们引入了 RelationalFactQA,这是一个新的基准,包含各种自然语言问题(配对 SQL)和金标准表格答案,专门设计用于评估结构化格式的知识检索。RelationalFactQA 能够分析不同的查询复杂度、输出大小和数据特征。我们的实验表明,即使是最先进的 LLM 也面临显著困难,在生成关系输出时事实准确率不超过 25%,并且随着输出维度的增加,性能显著下降。这些发现强调了当前 LLM 在综合结构化事实知识方面的关键局限性,并确立了 RelationalFactQA 作为衡量 LLM 事实性未来进展的关键资源。
引用
@article{arxiv.2505.21409,
title = {RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models},
author = {Dario Satriani and Enzo Veltri and Donatello Santoro and Paolo Papotti},
journal= {arXiv preprint arXiv:2505.21409},
year = {2025}
}