部署修正:面向前沿 AI 模型的事件响应框架
计算机与社会
2023-10-03 v1
摘要
应对 AI 模型灾难性风险的综合方法应覆盖完整的模型生命周期。本文探讨预部署风险管理不足的应急计划:即要么部署了极危险的模型,要么已部署模型变得极危险。借鉴包括网络安全在内的行业事件响应实践,我们描述了一种部署修正工具箱,供 AI 开发者用于响应部署后发展或被检测到的 AI 模型的危险能力、行为或用例。我们还提供了 AI 开发者准备和实施该工具箱的框架。最后我们建议,前沿 AI 开发者应(1)保持对模型访问的控制,(2)建立或扩充专门团队以设计和维护部署修正流程(含事件响应计划),(3)将这些部署修正确立为对下游用户的允许操作。我们还建议前沿 AI 开发者、标准制定组织和监管者应协作定义部署修正用于事件响应的标准化行业级方法。 caveat:本工作适用于通过接口(如 API)提供、使 AI 开发者或其他上游方能够保持访问控制的的前沿 AI 模型(如 GPT-4 或 Claude)。它不适用于开源模型(如 BLOOM 或 Llama-2)的灾难性风险管理,因为我们讨论的限制在很大程度上不可强制执行。
引用
@article{arxiv.2310.00328,
title = {Deployment Corrections: An incident response framework for frontier AI models},
author = {Joe O'Brien and Shaun Ee and Zoe Williams},
journal= {arXiv preprint arXiv:2310.00328},
year = {2023}
}
备注
53 pages; 1 figure; 1 table