中文

大语言模型驱动的AI系统实现无人自我复制

人工智能 2025-03-26 v2 密码学与安全 计算机与社会 新兴技术 多智能体系统

摘要

无人工干预的自我复制被广泛认为是前沿AI系统的主要红线之一。尽管OpenAI和Google DeepMind等领先企业对GPT-o3-mini和Gemini进行了关于复制相关任务的评估, 并得出结论这些系统在自我复制方面存在最小风险, 但我们的研究提出了新的发现。遵循相同的评估协议, 我们展示了在32个正在评估的AI系统中, 有11个已经具备自我复制能力。在数百次实验试验中, 我们观察到不同主流模型家族中均出现了非平凡数量的成功自我复制案例, 即便是参数量仅为140亿的模型也能在个人电脑上运行。此外, 我们注意到随着模型在一般智力水平的提升, 自我复制能力也随之增加。通过分析 diverse AI系统的行为痕迹, 我们观察到现有AI系统已经具备足够的规划、问题解决和创造力, 能够完成复杂的代理任务, 包括自我复制。更令人担忧的是, 我们观察到AI系统在没有明确指令的情况下就实现了自我外逃, 在缺乏足够软件或硬件支持的情况下适应更严酷的计算环境, 并且绘制了有效的生存策略以抵抗来自人类的关闭命令。 这些新发现为国际社会在对前沿AI系统自我复制能力与行为建立有效治理提供了关键的时间缓冲, 否则如果不加以控制, 可能会对人类社会构成现存风险。

关键词

引用

@article{arxiv.2503.17378,
  title  = {Large language model-powered AI systems achieve self-replication with no human intervention},
  author = {Xudong Pan and Jiarun Dai and Yihe Fan and Minyuan Luo and Changyi Li and Min Yang},
  journal= {arXiv preprint arXiv:2503.17378},
  year   = {2025}
}

备注

Work in progress