BizBench:面向商业与金融的定量推理基准
计算与语言
2024-03-13 v2
摘要
在商业和金融领域内回答问题需要推理、精确性以及广博的专业知识。这些要求共同使得该领域对大语言模型(LLM)而言十分困难。我们引入 BizBench,一个用于评估模型对现实金融问题推理能力的基准。BizBench 包含八项定量推理任务,侧重于通过程序合成对金融数据进行问答(QA)。我们基于新收集和增强的 QA 数据包含了三项金融主题的代码生成任务。此外,我们剥离出金融 QA 所需的推理能力:从金融文本和表格中读取以提取中间值,以及理解计算复杂解所需的金融概念和公式。这些任务共同评估模型的金融背景知识、解析金融文档的能力,以及用代码解决问题的能力。我们对开源和商用 LLM 进行了深入评估,对比并分析了以代码为中心和以语言为中心的模型的行为。我们表明当前的性能瓶颈源于 LLM 有限的商业和金融理解,凸显了在该领域内一个具有挑战性的定量推理基准的价值。
引用
@article{arxiv.2311.06602,
title = {BizBench: A Quantitative Reasoning Benchmark for Business and Finance},
author = {Rik Koncel-Kedziorski and Michael Krumdick and Viet Lai and Varshini Reddy and Charles Lovering and Chris Tanner},
journal= {arXiv preprint arXiv:2311.06602},
year = {2024}
}
备注
Work in progress