中文

小型模型能否推理法律文档?一项比较研究

计算与语言 2026-03-30 v1 人工智能

摘要

大语言模型在法律应用中展现出前景,但部署前沿模型引发了关于成本、延迟和数据隐私的担忧。我们通过测试九个模型在三个法律基准(ContractNLI、CaseHOLD和ECtHR)上的表现,使用五种提示策略(直接、思维链、少样本、BM25 RAG和密集RAG),评估了参数少于10B的模型是否可作为实用的替代方案。在每个配置使用三个随机种子的405次实验中,我们发现一个仅激活3B参数的Mixture-of-Experts模型在平均准确率上匹配GPT-4o-mini,同时在法律条款识别上超越它,且架构和训练质量比原始参数数量更重要。我们最大的模型(9B参数)整体表现最差。思维链提示被证明高度依赖任务,在合同蕴含任务上表现提升但在多项选择法律推理上退化,而少样本提示是最持续有效的策略。比较BM25和密集检索用于RAG,我们发现近乎相同的结果,表明瓶颈在于语言模型对检索上下文的使用而非检索质量。所有实验均通过云推理API进行,总成本为62美元,证明严谨的LLM评估无需专用GPU基础设施即可实现。

关键词

引用

@article{arxiv.2603.25944,
  title  = {Can Small Models Reason About Legal Documents? A Comparative Study},
  author = {Snehit Vaddi},
  journal= {arXiv preprint arXiv:2603.25944},
  year   = {2026}
}

备注

17 pages, 9 models, 5 prompting strategies, 3 legal benchmarks, 405 experiments