L-MARS:结合编排推理与智能体搜索的法律多智能体工作流
人工智能
2026-03-31 v3 计算与语言
摘要
我们提出了L-MARS(结合编排推理与智能体搜索的法律多智能体工作流),这是一个用于有依据的法律问答的多智能体检索框架。它将查询分解为结构化子问题,通过智能体网络搜索检索证据,通过验证智能体过滤结果,并合成带有引用的答案。现有的法律问答基准测试要么是闭卷推理,要么是在固定语料库上进行检索,但两者均无法涵盖需要当前法律信息的场景。我们引入了LegalSearchQA,这是一个包含五个法律领域共50个问题的基准测试,其答案依赖于模型训练数据之后发生的最新进展。L-MARS在LegalSearchQA上达到了96.0%的准确率,较零样本性能(58.0%)提升了38.0%,而思维链提示将性能降至30.0%。在Bar Exam QA(Zheng et al., 2025,一个包含594个律师资格考试问题的推理导向基准测试)上,检索带来的提升微乎其微(+0.7个百分点),这与先前的发现一致。这些结果表明,当任务需要最新的事实知识时,智能体检索能显著改善法律问答,但其收益取决于具体基准测试,凸显了以检索为中心的评估的必要性。代码和数据可在以下地址获取:https://github.com/boqiny/L-MARS
引用
@article{arxiv.2509.00761,
title = {L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic Search},
author = {Ziqi Wang and Boqin Yuan},
journal= {arXiv preprint arXiv:2509.00761},
year = {2026}
}