公民兵军竞赛:在合作-离合压力下演化LLM宪法
多智能体系统
2026-05-27 v1 计算机科学与博弈论
神经与进化计算
摘要
前沿LLM代理在目标冲突的代理环境中会进行勒索、破坏和文件泄露,暴露了基于单智能体或合作假设构建的对齐方法的局限性。最近的研究表明,LLM引导的演化搜索可以发现有效的合作宪法,但对抗性环境下的两个性质仍未被充分刻画:适应度函数是否实际引发对抗压力,以及LLM突变算子在对抗性专家目标下是否行为可靠。我们在公共物品游戏(PGG)和空间网格世界中,对抗性宪法共演化(Blue方合作者 vs Red方免费 rider,30代)进行研究。发现三个主要问题:(1)在PGG中,双方 faction 在 S 约为0.78 时收敛至近乎平衡的均衡,robust across tested multipliers m in {1.2, 1.5, 2.0, 3.0};(2)在独立计分环境中,按 faction 计分的结果在统计上彼此独立,相关系数 corr(S_B, S_R) = +0.088,且未产生对抗压力;采用得分优势适应度目标 S_own - S_opp 可恢复对抗压力;(3)在纯对抗适应度下,评估种子数 K 控制模式回归:K=2 时回归,而 K=5 时可在全部30代中维持强大的专家。虽然可以在受控的适应度和充足评估预算下实现自然语言宪法的对抗共演化,但演化出的Red方宪法作为可解释的红队测试 artifact,对于测试未来的合作设计具有重要意义。
引用
@article{arxiv.2605.26448,
title = {Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure},
author = {Ujwal Kumar and Arth Singh and Hershraj Niranjani and Machiko Hirota and Takehiro Takayanagi and Alice Saito and Eiji Kamioka and Phan Xuan Tan},
journal= {arXiv preprint arXiv:2605.26448},
year = {2026}
}
备注
15 pages, 5 figures