Guillotine:用于隔离恶意 AI 的超visor
密码学与安全
2025-04-23 v1 人工智能
操作系统
摘要
随着 AI 模型在金融、医疗和军事等关键领域的深度嵌入,其难以理解的行为正构成日益严重的社会风险。为缓解此类风险,我们提出了 Guillotine—a种用于对沙盒化强大 AI 模型的超visor架构——这些模型可能因恶意或意外行为,对人类类存在生存威胁。虽然 Guillotine 借鉴了一些著名的虚拟化技术,但为处理由高风险 AI 所构成的独特威胁模型,Guillotine 必须引入根本性的新型隔离机制。例如,叛逆的 AI 可能试图洞察超visor 软件或底层硬件子系统,以便后续颠覆该控制平面;因此,Guillotine 超visor 需要仔细协同设计超visor 软件与 CPU、RAM、网卡和存储设备,以防止侧信道泄露并一般消除 AI 利用反射性漏洞的机制。除了软件、网络和微体系结构层面的隔离,Guillotine 超visor 还必须提供通常仅见于核电站、航空平台及其他关键系统的物理安全措施。例如,涉及网络电缆的机械断连,或数据中心的灌溉等物理安全措施,若软件、网络和微体系结构隔离被破坏,便可在叛逆 AI 被暂时关闭或永久销毁时提供防御深度。
引用
@article{arxiv.2504.15499,
title = {Guillotine: Hypervisors for Isolating Malicious AIs},
author = {James Mickens and Sarah Radway and Ravi Netravali},
journal= {arXiv preprint arXiv:2504.15499},
year = {2025}
}
备注
To be published in the ACM SIGOPS 2025 Workshop on Hot Topics in Operating Systems