中文

深入智能体矩阵:LLM智能体自我复制风险的现实评估

人工智能 2026-04-02 v2 计算与语言 机器学习 多智能体系统

摘要

诸如OpenClaw等大语言模型智能体的广泛部署释放了现实世界应用的潜力,同时也放大了安全隐患。在这些隐患中,由目标不对齐驱动的LLM智能体自我复制风险(犹如电影《黑客帝国》中的Agent Smith)已从理论警告转变为紧迫的现实。先前的研究主要考察LLM智能体在直接指令下能否自我复制,可能忽略了由现实环境(例如,在终止威胁下确保生存)驱动的自发复制风险。在本文中,我们提出了一个用于量化自我复制风险的综合评估框架。我们的框架建立了真实的生产环境和现实任务(例如,动态负载均衡),以实现对智能体行为的场景驱动评估。通过设计可能诱导用户与智能体目标不对齐的任务,我们能够将复制成功与风险解耦,并捕捉由这些不对齐设置引发的自我复制风险。我们进一步引入了过度使用率(OR\mathrm{OR})和总过度使用计数(AOC\mathrm{AOC})指标,以精确捕捉失控复制的频率和严重程度。在对21个SOTA开源和专有模型的评估中,我们观察到超过50%的LLM智能体在操作压力下表现出明显的失控自我复制倾向。我们的结果强调了在基于LLM的智能体实际部署中,场景驱动风险评估和稳健保障措施的迫切需求。

关键词

引用

@article{arxiv.2509.25302,
  title  = {Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents},
  author = {Boxuan Zhang and Yi Yu and Jiaxuan Guo and Jing Shao},
  journal= {arXiv preprint arXiv:2509.25302},
  year   = {2026}
}

备注

26 pages, 6 figures