中文

制度 AI:通过公共治理图治理多智能体 Cournot 市场中的 LLM 合谋

计算机科学与博弈论 2026-01-21 v2 人工智能

摘要

多智能体 LLM 集成可能收敛于协调的、社会有害的均衡。本文推进了一个用于评估制度 AI 的实验框架,这是我们系统级的 AI 对齐方法,将对齐从智能体空间中的偏好工程重新构建为制度空间中的机制设计。该方法的核心是治理图,这是一个公开、不可篡改的清单,声明了合法状态、转换、制裁和恢复路径;一个预言机/控制器运行时解释该清单,将可执行的后果附加到协调的证据上,同时记录一个加密密钥的、仅追加的治理日志以供审计和溯源。我们应用制度 AI 框架来治理先前工作记录的 Cournot 合谋案例,并比较了三种机制:无治理(源自 Cournot 市场结构的基线激励)、宪制(作为固定书面反合谋宪章实施的仅提示策略即提示禁止)和制度(基于治理图)。在包括跨供应商对在内的六种模型配置中(N=90 次运行/条件),制度机制产生了合谋的大幅减少:平均等级从 3.1 降至 1.8(Cohen's d=1.28),严重合谋发生率从 50% 降至 5.6%。仅提示的宪制基线未产生可靠改善,表明声明性禁止在优化压力下不具约束力。这些结果表明,多智能体对齐可能受益于被构建为制度设计问题,其中治理图可以为对齐相关的集体行为提供易于处理的抽象。

关键词

引用

@article{arxiv.2601.11369,
  title  = {Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs},
  author = {Marcantonio Bracale Syrnikov and Federico Pierucci and Marcello Galisai and Matteo Prandi and Piercosma Bisconti and Francesco Giarrusso and Olga Sorokoletova and Vincenzo Suriani and Daniele Nardi},
  journal= {arXiv preprint arXiv:2601.11369},
  year   = {2026}
}