千次泄漏:AI回答中不安全信息泄露的威胁
密码学与安全
2024-10-31 v2 人工智能
计算机与社会
摘要
对前沿语言模型滥用和越狱攻击的脆弱性,促使开发者采用过滤器和对齐训练等安全措施,以通过对抗性提示鲁棒性来确保安全。我们认为,鲁棒性在确保安全目标方面是根本不够的,当前的防御措施和评估方法未能考虑双意图查询及其为恶意目标而构成的风险。为量化这些风险,我们引入了一种基于模型输出中不可允许信息泄露的新型安全评估框架,演示了我们提出的问句分解攻击如何比传统越狱更有效地从受 censorship 的大语言模型中提取危险知识。我们提出的评估方法背后是一种新颖的信息论威胁模型,区别于安全威胁模型(如越狱),其成功标准在于从受害者输出中推断不可允许的知识,而非强制受害者产生明确的不可允许输出。通过我们的信息论框架,我们表明,为抵御推理型威胁,防御机制必须确保信息审查,限制不可允许信息的泄露。然而,我们证明了此类防御必然导致安全性与实用性之间的权衡。
引用
@article{arxiv.2407.02551,
title = {Breach By A Thousand Leaks: Unsafe Information Leakage in `Safe' AI Responses},
author = {David Glukhov and Ziwen Han and Ilia Shumailov and Vardan Papyan and Nicolas Papernot},
journal= {arXiv preprint arXiv:2407.02551},
year = {2024}
}