中文

仅供数好子句:比较大语言模型与领域训练小型语言模型在结构化合同提取中的表现

计算与语言 2026-05-08 v1 计算机与社会

摘要

本文评估了领域训练的小型语言模型 (SLM) 是否能以极低的成本超越前沿大型语言模型在结构化合同提取中的性能。我们测试了 Olava Extract,这是一个自托管的法律领域混合专家模型,对抗五个前沿模型。Olava Extract 在本研究中实现了最强的整体性能,宏 F1 为 0.812,微 F1 为 0.842,同时将推理成本降低了 78% 至 97%。它还实现了最高的精确率分数,产生了更少的幻觉和不受支持的提取,这在法律工作流程中尤为重要,因为幻觉会造成运营风险和后续审查负担。我们的发现表明,高性能、相当于人类的法律 AI 已不再需要最大的外部托管模型。更广泛地说,它们挑战了商业有价值企业 AI 能力必须依赖于越来越大的模型、巨大的基础设施支出以及由中心托管提供商支配的假设。

关键词

引用

@article{arxiv.2605.05532,
  title  = {A Few Good Clauses: Comparing LLMs vs Domain-Trained Small Language Models on Structured Contract Extraction},
  author = {Nicole Lincoln and Nick Whitehouse and Jaron Mar and Rivindu Perera},
  journal= {arXiv preprint arXiv:2605.05532},
  year   = {2026}
}