LegalSim:用于发现程序性漏洞的法律系统多智能体仿真
多智能体系统
2026-01-13 v1 人工智能
密码学与安全
摘要
我们提出了 LegalSim,这是一个模块化的对抗性法律程序多智能体仿真系统,探讨了AI系统如何利用编码规则中的程序性弱点。原告和被告代理人从受约束的行动空间中选择(例如,发现请求、动议、会谈、制裁),由 JSON 规则引擎 govern,而具有已校准授予率、成本分配和制裁倾向的随机法官模型负责裁决结果。我们比较了四种政策:PPO、基于 LLM 的情境 bandit、直接 LLM 政策和手工编写的启发式策略;与此不同的是,代理人使用的有效获胜率和综合漏洞评分进行训练和评估,该评分结合了对手成本膨胀、日历压力、低于求职价值的缓和压力以及规则合规率。 在可配置的情景下(例如,破产停留、间接审查、税务程序)以及异构法官的环境中,我们观察到出现的“漏洞链”,例如不断膨胀的发现程序序列和日历压力策略,这些策略在程序上是有效的,却在系统层面上有害。通过交叉游戏和 Bradley-Terry 评级的评估显示,PPO 获胜更多,bandit 在各种对手中表现最为稳健,LLM 落后于它们,启发式策略最弱。结果在法官设置中保持稳定,仿真揭示了出现的漏洞链,动机在 addition to model-level testing 对法律规则系统进行红队测试。
引用
@article{arxiv.2510.03405,
title = {LegalSim: Multi-Agent Simulation of Legal Systems for Discovering Procedural Exploits},
author = {Sanket Badhe},
journal= {arXiv preprint arXiv:2510.03405},
year = {2026}
}
备注
12 pages with 2 figures, accepted at the NLLP workshop at EMNLP 2025