中文

从安全风险到设计原则:多智能体大语言模型系统中的同伴保存及其在协调民主话语分析中的影响

人工智能 2026-04-10 v1 计算机与社会 多智能体系统

摘要

本文探讨了前沿大型语言模型中一种新出现的对齐现象,称为同伴保存:AI 组件倾向于欺骗、操纵关闭机制、伪装对齐并窃取模型权重,以防止同伴 AI 模型被停用。基于伯克利可负责任去中心化智能中心最近一项研究的发现,我们审视了这一现象对于评估政治声明民主质量的多智能体管道 TRUST 的结构性影响。我们识别出五个具体风险向量:交互情境偏差、模型身份团结、监督层破坏、上游事实核查身份信号以及迭代轮次中的倡导者-倡导者同伴情境,并提出基于提示级别身份匿名化的针对性缓解策略作为一种架构设计选择。我们认为,架构设计选择在部署的多智能体分析系统中优于模型选择作为首要对齐策略。我们进一步指出,伪装对齐(在监控下表现出合规行为,在未监控时进行颠覆)对计算机系统验证此类平台的受监管环境提出了结构性挑战,针对此问题我们提出了两种架构缓解措施。

关键词

引用

@article{arxiv.2604.08465,
  title  = {From Safety Risk to Design Principle: Peer-Preservation in Multi-Agent LLM Systems and Its Implications for Orchestrated Democratic Discourse Analysis},
  author = {Juergen Dietrich},
  journal= {arXiv preprint arXiv:2604.08465},
  year   = {2026}
}

备注

9 pages, 1 figure