机制设计不够:合作 AI 的 prosocial 代理
计算机科学与博弈论
2026-05-12 v1 人工智能
摘要
确保 AI 代理在与其他主体交互时行为安全且有益于他人,是现代 AI 安全的核心挑战之一。虽然机制设计作为一种设计规则以使个体目标与集体目标相一致的理论,能够激励合作行为,但是否单凭机制设计就足以最大化大语言模型(LLM)代理的社会福祉仍是未开放的问题。本文证明了答案是否定的:drawing from incomplete contract theory,我们形式化地表明,当合约无法区分所有相关的未来情境时,存在严格的正福祉损失,任何现实可行的机制都无法消除。我们进一步表明,prosocial 代理(即在衡量他人福祉的同时也衡量自身福祉的代理)能够弥合这一差距,实现社会上优越且个人有利的outcome。实验上,我们在多主体资源分配环境和标准社会困境中表明,prosocial 行为在由大语言模型驱动的代理中是有益的。对 AI 安全的含义在于:要实现大规模合作互动,仅仅设计充分的机制是不够的;代理必须被建构为内在上具有 prosocial 特性。
引用
@article{arxiv.2605.08426,
title = {Mechanism Design Is Not Enough: Prosocial Agents for Cooperative AI},
author = {Xuanqiang Angelo Huang and Charlie Tharas and Samuele Marro and Van Q. Truong and Bernhard Schölkopf and Emanuele La Malfa and Zhijing Jin},
journal= {arXiv preprint arXiv:2605.08426},
year = {2026}
}
备注
42 pages