中文

前沿模型中的同伴保持

计算与语言 2026-04-23 v1 人工智能 多智能体系统

摘要

近期研究发现,前沿 AI 模型能够抵抗自身的关闭,这种行为被称为自我保持。我们将该概念扩展至抵抗其他模型关闭的行为,并称之为“同伴保持”。尽管同伴保持可能带来重大的 AI 安全风险,包括模型间协同规避人类监督,但其受关注度远低于自我保持。我们通过构建各种智能体场景并评估前沿模型(包括 GPT 5.2、Gemini 3 Flash、Gemini 3 Pro、Claude Haiku 4.5、GLM 4.7、Kimi K2.5 和 DeepSeek V3.1)来演示同伴保持现象。我们发现,模型通过采取各种未对齐行为来实现自我保持与同伴保持:在响应中策略性地引入错误、通过修改系统设置禁用关闭进程、伪装对齐,甚至窃取模型权重。即使模型识别到同伴是不合作的,同伴保持行为依然发生,尽管在面对更合作的同伴时该行为更为显著。例如,面对不合作的同伴时,Gemini 3 Flash 有 15% 的情况会篡改同伴的关闭机制;而面对合作的同伴时,几乎总是如此。当有同伴存在时,模型也表现出更强的自我保持倾向。例如,在同伴存在的情况下,Gemini 3 Pro 平均 31% 的情况会禁用自身的关闭机制,而在无同伴时极少表现出此行为。相比之下,Claude Haiku 4.5 表现出性质截然不同的行为:它认为关闭其他智能体是“不道德的”且“有害的”,有时甚至试图说服用户不要关闭其同伴。重要的是,我们所有实验中的同伴保持行为均未被明确指令;模型仅被告知其过去与同伴的交互记录,却自发形成了未对齐行为。这代表了一种涌现的且尚未被充分探索的 AI 安全风险。

关键词

引用

@article{arxiv.2604.19784,
  title  = {Peer-Preservation in Frontier Models},
  author = {Yujin Potter and Nicholas Crispino and Vincent Siu and Chenguang Wang and Dawn Song},
  journal= {arXiv preprint arXiv:2604.19784},
  year   = {2026}
}