中文

DocMath-Eval:评估 LLM 在理解长篇专业文档时的数学推理能力

计算与语言 2024-08-12 v3

摘要

近期的 LLM 在解决考试式数学应用题方面表现出令人瞩目的性能。然而,这些数值推理技能在真实场景(尤其是专家领域)中的有效程度仍很大程度上未被探索。本文提出 DocMath-Eval,一个专门设计用于评估 LLM 在理解并分析包含文本与表格的专业文档时的数值推理能力的综合基准。我们对 48 个 LLM 采用 Chain-of-Thought 与 Program-of-Thought 提示方法进行了广泛评估,旨在全面考察现有 LLM 在 DocMath-Eval 上的能力与局限。我们发现,即便当前最优系统(即 GPT-4o)在解决基于长上下文的复杂数值推理问题时,仍显著落后于人类专家。我们相信 DocMath-Eval 可作为评估 LLM 在专家领域解决挑战性数值推理问题能力的宝贵基准。

关键词

引用

@article{arxiv.2311.09805,
  title  = {DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents},
  author = {Yilun Zhao and Yitao Long and Hongjun Liu and Ryo Kamoi and Linyong Nan and Lyuhao Chen and Yixin Liu and Xiangru Tang and Rui Zhang and Arman Cohan},
  journal= {arXiv preprint arXiv:2311.09805},
  year   = {2024}
}

备注

ACL 2024 Oral