中文

Scaling Legal AI:基准测试 Mamba 与 Transformer 在法规分类与案件法律检索中的表现

计算机与社会 2025-09-03 v1 人工智能 机器学习

摘要

法规语料库和司法决策的快速增长需要具备分类与检索能力的可扩展法律AI系统,以处理极长上下文。Transformer架构(如Longformer、DeBERTa)主导当前法律NLP基准,但因注意力成本呈二次方增长,限制了效率和可扩展性。本文首次对比评估了Mamba——一种具有线性时间选择性机制的状态空间模型(SSM)——与领先Transformer模型在法规分类和案件检索任务中的表现。我们在开源法律语料库(包括LexGLUE、EUR-Lex和ILDC)上进行评估,覆盖司法标记、司法结果预测和案件检索等任务。指标包括准确率、检索准确率、平均倒数排名(MRR)和归一化折扣累积收益(nDCG),以及以token/s为单位的吞吐量和最大上下文长度。结果表明,Mamba的线性扩展能力使其能够处理远超Transformer模型的法律文档长度,同时保持或超越检索和分类性能。该研究引入了用于长上下文建模的全新法律NLP基准套件,并提供开源代码和数据集以支持可重复性。我们的发现揭示了状态空间模型与Transformer之间的权衡,为在法规分析、司法决策支持和政策研究中部署可扩展法律AI提供了指导。

关键词

引用

@article{arxiv.2509.00141,
  title  = {Scaling Legal AI: Benchmarking Mamba and Transformers for Statutory Classification and Case Law Retrieval},
  author = {Anuraj Maurya},
  journal= {arXiv preprint arXiv:2509.00141},
  year   = {2025}
}