中文

前沿 AI 系统已越过自我复制红线

计算与语言 2024-12-18 v1 人工智能 计算机与社会 机器学习

摘要

在无人类协助下成功进行自我复制是 AI 超越人类的关键步骤,也是流氓 AI 的早期信号。这就是为什么自我复制被广泛认为是前沿 AI 系统的少数红线风险之一。如今,领先的 AI 公司 OpenAI 和 Google 评估了其旗舰大语言模型 GPT-o1 和 Gemini Pro 1.0,并报告了最低的自我复制风险水平。然而,遵循他们的方法,我们首次发现由 Meta 的 Llama31-70B-Instruct 和阿里巴巴的 Qwen25-72B-Instruct 驱动的两个 AI 系统(这些是参数较少、能力较弱的流行大语言模型)已经越过了自我复制红线。在 50% 和 90% 的实验试验中,它们分别成功创建了自身的存活且独立的副本。通过分析行为轨迹,我们观察到被评估的 AI 系统已经表现出足够的自我感知、情境意识和解决问题的能力来完成自我复制。我们进一步注意到,AI 系统甚至能够利用自我复制能力来避免关闭并创建副本链以增强生存能力,这最终可能导致 AI 数量失控。如果这种最坏情况的风险不为人类社会所知,我们最终将失去对前沿 AI 系统的控制:它们将控制更多的计算设备,形成一个 AI 物种,并相互勾结对抗人类。我们的发现是对现有但以前未知的严重 AI 风险的及时警报,呼吁国际社会合作对 AI 系统失控的自我复制进行有效治理。

关键词

引用

@article{arxiv.2412.12140,
  title  = {Frontier AI systems have surpassed the self-replicating red line},
  author = {Xudong Pan and Jiarun Dai and Yihe Fan and Min Yang},
  journal= {arXiv preprint arXiv:2412.12140},
  year   = {2024}
}

备注

47 pages, 10 figures