中文

协同暂停:一种面向前沿 AI 开发者的基于评估的协调机制

计算机与社会 2023-10-03 v1

摘要

随着人工智能(AI)模型规模扩大,新的能力可能无意且不可预测地涌现,其中一些可能具有危险性。作为应对,危险能力评估已成为一种新的风险评估工具。但如果前沿 AI 开发者确实发现了足够危险的能力,他们该怎么做?本文聚焦于一种可能的应对:协同暂停。它提出了一种基于评估的协调机制,包含五个主要步骤:(1)对前沿 AI 模型进行危险能力评估。(2)每当某个模型未通过一组评估时,开发者暂停某些研发活动。(3)一旦发现具有危险能力的模型,通知其他开发者。他们也暂停相关的研发活动。(4)对发现的能力进行分析,并采取充分的安全预防措施。(5)开发者仅在某些安全阈值达到后才恢复其暂停的活动。本文还讨论了该机制的四种具体版本。第一版中,暂停完全自愿并依赖对开发者的公众压力。第二版中,参与开发者在特定条件下集体同意暂停。第三版中,单一审计者评估多个开发者的模型,这些开发者同意若任一模型未通过一组评估则暂停。第四版中,法律要求开发者运行评估,并在发现危险能力时暂停。最后,本文讨论了我们提出的协调机制的可取性与可行性。结论是,协同暂停是应对前沿 AI 模型新兴风险的一种有前景的机制。然而,需克服若干实际与法律障碍,尤其是如何避免违反反垄断法。

关键词

引用

@article{arxiv.2310.00374,
  title  = {Coordinated pausing: An evaluation-based coordination scheme for frontier AI developers},
  author = {Jide Alaga and Jonas Schuett},
  journal= {arXiv preprint arXiv:2310.00374},
  year   = {2023}
}

备注

24 pages, 3 figures, 1 table