揭示大型语言模型在表格信息检索中的局限性
计算与语言
2024-06-07 v1
摘要
表格因其高信息密度和广泛应用,被认为是重要的信息来源。从表格中检索信息(TIS)是大型语言模型(LLM)的关键能力,构成知识库问答系统的基础。然而,该领域目前缺乏彻底且可靠的评估。本文引入更可靠的用于表格信息检索(TabIS)基准。为避免由文本相似性指标引起的不可靠评估,TabIS采用单选问答格式(每个问题两个选项)而非文本生成格式。我们建立了有效的管道用于生成选项,确保其难度和质量。在12个LLM上进行的实验表明,尽管GPT-4-turbo的表现略显满意,但其他专有和开源模型表现不足。进一步分析显示,LLM对表格结构的理解较差,且难以在TIS性能与对抗伪相关表格(常见于检索增强系统)的鲁棒性之间进行平衡。这些发现揭示了LLM在从表格中检索信息方面的局限性和潜在挑战。我们公开数据和代码以促进该领域的进一步研究。
引用
@article{arxiv.2406.04113,
title = {Uncovering Limitations of Large Language Models in Information Seeking from Tables},
author = {Chaoxu Pang and Yixuan Cao and Chunhao Yang and Ping Luo},
journal= {arXiv preprint arXiv:2406.04113},
year = {2024}
}
备注
Findings of ACL 2024