中文

BizBench:面向商业与金融的定量推理基准

计算与语言 2024-03-13 v2

摘要

在商业和金融领域内回答问题需要推理、精确性以及广博的专业知识。这些要求共同使得该领域对大语言模型(LLM)而言十分困难。我们引入 BizBench,一个用于评估模型对现实金融问题推理能力的基准。BizBench 包含八项定量推理任务,侧重于通过程序合成对金融数据进行问答(QA)。我们基于新收集和增强的 QA 数据包含了三项金融主题的代码生成任务。此外,我们剥离出金融 QA 所需的推理能力:从金融文本和表格中读取以提取中间值,以及理解计算复杂解所需的金融概念和公式。这些任务共同评估模型的金融背景知识、解析金融文档的能力,以及用代码解决问题的能力。我们对开源和商用 LLM 进行了深入评估,对比并分析了以代码为中心和以语言为中心的模型的行为。我们表明当前的性能瓶颈源于 LLM 有限的商业和金融理解,凸显了在该领域内一个具有挑战性的定量推理基准的价值。

关键词

引用

@article{arxiv.2311.06602,
  title  = {BizBench: A Quantitative Reasoning Benchmark for Business and Finance},
  author = {Rik Koncel-Kedziorski and Michael Krumdick and Viet Lai and Varshini Reddy and Charles Lovering and Chris Tanner},
  journal= {arXiv preprint arXiv:2311.06602},
  year   = {2024}
}

备注

Work in progress