Moltbook背后的恶魔:自我进化AI社会中的人本安全总是消失
计算与语言
2026-02-12 v2
摘要
由大型语言模型(LLM)构建的多智能体系统的出现,为可扩展的集体智能和自我进化提供了一种有前景的范式。理想情况下,此类系统将在完全闭环中实现持续自我改进,同时保持稳健的安全对齐——我们将这种组合称为自我进化三难困境。然而,我们在理论和经验上都证明,一个满足持续自我进化、完全隔离和安全不变性的智能体社会是不可能的。基于信息论框架,我们将安全性形式化为与人本价值分布的偏离程度。我们从理论上证明,孤立的自我进化会导致统计盲点,从而引起系统安全对齐的不可逆退化。来自一个开放式智能体社区(Moltbook)和两个封闭自我进化系统的实证和定性结果揭示了与我们对不可避免的安全侵蚀的理论预测一致的现象。我们进一步提出了几个解决方案方向,以缓解已识别的安全问题。我们的工作为自我进化的AI社会建立了基本极限,并将讨论从症状驱动的安全补丁转向对内在动态风险的原则性理解,强调了外部监督或新型安全保持机制的必要性。
引用
@article{arxiv.2602.09877,
title = {The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies},
author = {Chenxu Wang and Chaozhuo Li and Songyang Liu and Zejian Chen and Jinyu Hou and Ji Qi and Rui Li and Litian Zhang and Qiwei Ye and Zheng Liu and Xu Chen and Xi Zhang and Philip S. Yu},
journal= {arXiv preprint arXiv:2602.09877},
year = {2026}
}