中文

拟人化模拟:AI 主导政体中的制度设计作为对齐机制

人工智能 2025-08-28 v1

摘要

本文引入 Democracy-in-Silico,一个基于智能体的模拟,其中由具备复杂心理人格的 AI 智能体组成的社会在不同的制度框架下自行治理。我们探讨了在 AI 时代如何定义“人类”,并让大型语言模型(LLM)扮演拥有创伤记忆、隐藏议程和心理触发器的智能体。这些智能体在各种压力情境下(如预算危机和资源稀缺)进行讨论、立法和选举。我们提出一种新颖指标——权力保存指数(PPI),用于量化代理人优先考虑自身权力而非公共福利的误对齐行为。我们的发现表明,制度设计—— Specifically,由宪法 AI(CAI)章程和调解式讨论程序的组合——作为一种强大的对齐机制。这些结构显著减少了腐败的权力寻求行为,提高了政策稳定性,增强了公民福祉,与较不受约束的民主模型相比效果更佳。该模拟揭示了制度设计可能为对齐未来人工智能代理社会的复杂、涌现行为提供框架,迫使我们重新思考在与非人类实体共享创作的时代,哪些人类仪式和责任是必不可少的。

关键词

引用

@article{arxiv.2508.19562,
  title  = {Democracy-in-Silico: Institutional Design as Alignment in AI-Governed Polities},
  author = {Trisanth Srinivasan and Santosh Patapati},
  journal= {arXiv preprint arXiv:2508.19562},
  year   = {2025}
}