中文

MASLegalBench:多智能体系统在演绎法律推理中的基准测试

人工智能 2025-10-01 v2 计算与语言

摘要

多智能体系统(MAS)利用大型语言模型(LLMs)的卓越能力,在处理复杂任务方面展现出巨大潜力。在此背景下,将MAS与法律任务相结合是至关重要的一步。尽管先前的研究已为LLM智能体开发了法律基准,但均未专门针对MAS的独特优势进行设计,例如任务分解、智能体专门化与灵活训练。事实上,评估方法的缺失限制了MAS在法律领域的潜力。为填补这一空白,我们提出MASLegalBench,一个专为MAS量身定制并采用演绎推理方法设计的法律基准。我们的基准以GDPR为应用场景,包含广泛的背景知识,并涵盖复杂的推理过程,有效反映了现实法律情况的错综复杂性。此外,我们手动设计了多种基于角色的MAS,并使用不同的最先进LLMs进行了广泛实验。我们的结果突显了现有模型与MAS架构的优势、局限性以及潜在的改进方向。

关键词

引用

@article{arxiv.2509.24922,
  title  = {MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning},
  author = {Huihao Jing and Wenbin Hu and Hongyu Luo and Jianhui Yang and Wei Fan and Haoran Li and Yangqiu Song},
  journal= {arXiv preprint arXiv:2509.24922},
  year   = {2025}
}