AI 的安全人类监督:社会技术背景下的威胁建模
密码学与安全
2026-03-06 v2 计算机与社会
人机交互
摘要
人类对 AI 的监督被提倡作为一种防范不准确输出、系统故障或侵犯基本权利等风险的保障措施,并在欧洲 AI 法案等法规中被强制要求。然而,关于人类监督的辩论主要集中在有效性上,却忽略了一个关键维度:人类监督的安全性。我们认为,人类监督在 AI 操作的安全性、保障性和问责制架构中创造了一个新的攻击面。借鉴网络安全视角,我们将人类监督建模为一种 IT 应用程序,以便对人类监督过程进行系统的威胁建模。威胁建模使我们能够识别人类监督中的安全风险,并指出可能的缓解策略。我们的贡献是:(1)引入了关于人类监督的安全视角;(2)为研究人员和从业者提供如何从安全角度处理其人类监督应用的指导;(3)提供攻击向量和强化策略的系统概述,以实现安全的 AI 人类监督。
引用
@article{arxiv.2509.12290,
title = {Secure human oversight of AI: Threat modeling in a socio-technical context},
author = {Jonas C. Ditz and Veronika Lazar and Elmar Lichtmeß and Carola Plesch and Matthias Heck and Kevin Baum and Markus Langer},
journal= {arXiv preprint arXiv:2509.12290},
year = {2026}
}