AI 控制安全案例的草图
人工智能
2025-01-30 v1 密码学与安全
软件工程
摘要
随着 LLM 代理造成危害的能力日益增强,AI 开发者可能越来越依赖监控等控制措施来证明其安全性。我们勾勒了开发者如何构建一个“控制安全案例”,这是一个结构化论证,证明模型无法破坏控制措施以导致不可接受的结果。作为案例研究,我们勾勒了一个论证,证明一个假设部署在 AI 公司内部的 LLM 代理不会泄露敏感信息。该草图依赖于“控制评估”中的证据,其中红队故意设计模型在部署环境的代理中泄露数据。安全案例随后取决于几个主张:(1) 红队充分激发了模型泄露数据的能力,(2) 控制措施在部署中至少保持同样有效,(3) 开发者保守地外推模型性能以预测部署中数据泄露的概率。这个安全案例草图是朝着更具体的论证迈出的一步,这些论证可用于证明一个具有危险能力的 LLM 代理可以安全部署。
引用
@article{arxiv.2501.17315,
title = {A sketch of an AI control safety case},
author = {Tomek Korbak and Joshua Clymer and Benjamin Hilton and Buck Shlegeris and Geoffrey Irving},
journal= {arXiv preprint arXiv:2501.17315},
year = {2025}
}