中文

误用防护措施的安全案例示例

机器学习 2025-05-26 v1 人工智能

摘要

现有的 AI 误用防护评估提供了碎片化的证据,往往难以与实际决策联系起来。为弥合这一差距,我们描述了一个贯穿整个论证(即“安全案例”),说明误用防护将 AI assistant 的风险降低到低水平。我们首先描述了一个假设的开发商对防护措施进行的红队测试,估算规避这些防护所需的工作量。随后,开发商将该估算输入定量的“提升模型”(https://www.aimisusemodel.com/),以确定由防护措施引入的障碍会如何抑制误用行为。此程序在部署期间提供持续的风险信号,帮助开发商快速应对新出现的威胁。最后,我们描述如何将这些组件整合成一个简单的安全案例。我们的工作提供了一套具体路径——尽管并非唯一路径——以严格论证 AI 误用风险已降低。

关键词

引用

@article{arxiv.2505.18003,
  title  = {An Example Safety Case for Safeguards Against Misuse},
  author = {Joshua Clymer and Jonah Weinbaum and Robert Kirk and Kimberly Mai and Selena Zhang and Xander Davies},
  journal= {arXiv preprint arXiv:2505.18003},
  year   = {2025}
}