基于国家安全任务基准的后向链式控制损失缓解措施
计算机与社会
2026-05-21 v1 密码学与安全
摘要
可供选择和许可是针对高风险部署情境(如国家安全)中控制损失(Loss of Control, LoC)威胁的有前景且紧迫的安全杠杆。国防和情报部门的部署者可以依赖多种方法来确定应优先考虑哪些可供选择和许可,例如结构化威胁建模、部署前代理人评估、部署后持续监控以及AI安全案例。本文提出了一种补充且经验性的方法,利用现有的以特定任务为导向的基准:从AI系统在国家安全基准上的错误中反向链式构建控制损失缓解措施。该方法包含三个步骤,允许国家安全部署者从他们自己可以生成的证据中开始构建控制损失缓解措施。首先,部署者对AI系统进行评估,使用近似真实任务情景的基准。其次,部署者聚焦于AI系统对基准问题所提供的错误响应,并反向链式分析如果AI系统遵循这些错误答案中描述的行动,可能导致的下游伤害的可供选择和许可。最后,部署者对这些可供选择和许可进行有选择的干预,瓶颈化导致伤害的路径,同时保留AI系统执行正确动作的能力。我们通过在证券分类衍生问题上的示范性基准问题来说明这一方法。
引用
@article{arxiv.2605.21095,
title = {Backchaining Loss of Control Mitigations from Mission-Specific Benchmarks in National Security},
author = {Matteo Pistillo and Samantha Faraone and Joshua Herman},
journal= {arXiv preprint arXiv:2605.21095},
year = {2026}
}