中文

Better Bill GPT:比较大型语言模型对抗法律发票审阅者

计算与语言 2025-04-07 v1

摘要

法律发票审阅工作成本高昂、结果不一致且耗时,传统上由法律运营部门、律师或计费专家逐行审查发票合规性。本研究首次对大型语言模型(LLM)与人类发票审阅者——包括初级律师、经验丰富的律师和法律运营专业人士——进行经验比较,评估其准确性、速度和成本效益。我们对比评估最先进的LLM,并以专家法律专业人士建立的真实答案为基准,实证结果显示LLM在每个指标上都显著优于人类。在发票批准决策方面,LLM达到最高可达92%的准确率,超越了经验丰富律师的72%上限。在细粒度水平上,LLM在项目分类方面表现领先,顶级模型的F值达到81%,而最佳人类团队的F值仅为43%。速度对比更为显著——律师需要194至316秒才能完成对一张发票的审阅,而LLM只需3.6秒即可完成。成本方面,AI将审阅费用削减了99.97%,将人类发票审阅者平均每张发票的处理成本从$4.27降至几美分。这些结果凸显了AI在法律支出管理中的演变作用。随着律师事务所和企业法律部门持续面临效率问题,本研究标志着LLM驱动的法律支出管理时代不再遥远,已经到来。挑战在于,AI是否能够像人类审阅者一样表现良好已不再是问题,关键在于法律团队如何战略性地融入AI,如何在自动化与人类判断之间取得平衡。

关键词

引用

@article{arxiv.2504.02881,
  title  = {Better Bill GPT: Comparing Large Language Models against Legal Invoice Reviewers},
  author = {Nick Whitehouse and Nicole Lincoln and Stephanie Yiu and Lizzie Catterson and Rivindu Perera},
  journal= {arXiv preprint arXiv:2504.02881},
  year   = {2025}
}