中文

BLT:大语言模型能否处理基础法律文本?

计算与语言 2024-10-18 v3 人工智能

摘要

我们发现当前最佳公开可用 LLM(如 GPT-4 和 Claude)在处理基础法律文本方面表现不佳。这促使我们构建一个由律师和律师助理期望 LLM 能够零样本处理的示例组成的基准,例如查找证人证词某一行的文本或合同某小节的文本。LLM 在该基准上的糟糕表现令其直接用于法律实务的可靠性受到质疑。然而,在我们的训练集上微调即使是一个小模型也能使其达到近乎完美的表现。该基准将有益于为下游法律任务微调 LLM,以及追踪 LLM 处理基础法律任务时的原生可靠性。

关键词

引用

@article{arxiv.2311.09693,
  title  = {BLT: Can Large Language Models Handle Basic Legal Text?},
  author = {Andrew Blair-Stanek and Nils Holzenberger and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2311.09693},
  year   = {2024}
}