中文

野外表格理解基准测试

计算与语言 2024-12-16 v1

摘要

大型语言模型 (LLM) 虽在众多知识密集型任务中占据主导地位,但在理解长时间表格文本混合内容方面(如学术论文和财务报告)仅取得有限成功。近期的长情境 LLM 进展为该领域带来了新的可能性。尽管如此,我们识别出两个障碍:(1) 先前的表格问答 (TableQA) 基准测试聚焦于无上下文的孤立表格,难以评估模型在真实场景中的表现。(2) 先前的基准测试仅关注表格理解的某些狭窄技能集合,如表格识别、数据操作/计算、表格总结等,而熟练的人类则会综合运用这些技能。在本工作中,我们引入 TableQuest,一个新的基准测试,旨在评估 LLM 在金融报告中自然表格丰富情境下的整体表格理解能力。我们采用严格的数据处理和过滤程序,确保问答对具有逻辑、合理性和多样性。我们实验了 7 个最先进的模型,发现尽管在定位事实方面表现合理,但在执行更复杂的推理或多步骤计算时常常堕落。我们随后进行了质性研究,探讨了失败模式,并讨论了构建具有挑战性基准测试的难点。我们将本研究的评估数据、判断程序和结果公开于可供研究之用,以促进该领域的研究。

关键词

引用

@article{arxiv.2412.09884,
  title  = {Benchmarking Table Comprehension In The Wild},
  author = {Yikang Pan and Yi Zhu and Rand Xie and Yizhi Liu},
  journal= {arXiv preprint arXiv:2412.09884},
  year   = {2024}
}

备注

Accepted at TRL Workshop@Neurips 2024. Link to data https://github.com/boson-ai/Table_eval_public