模型吮吸:一种针对 LLM 的提取攻击
机器学习
2023-09-20 v1 人工智能
计算与语言
密码学与安全
摘要
Model Leeching 是一种针对大语言模型(LLM)的新型提取攻击,能够将目标任务知识从目标 LLM 蒸馏至参数量缩减的模型中。我们通过从 ChatGPT-3.5-Turbo 中提取任务能力来展示该攻击的有效性:仅花费 $50 API 成本即达到 73% 的精确匹配(EM)相似度,以及 SQuAD 上 75% 的 EM 与 87% 的 F1 准确率。我们进一步展示了通过对经 Model Leeching 提取出的模型实施对抗攻击迁移、从而对目标 LLM 进行 ML 攻击前置的可行性,该方式应用于 ChatGPT-3.5-Turbo 时使攻击成功率提升了 11%。
引用
@article{arxiv.2309.10544,
title = {Model Leeching: An Extraction Attack Targeting LLMs},
author = {Lewis Birch and William Hackett and Stefan Trawicki and Neeraj Suri and Peter Garraghan},
journal= {arXiv preprint arXiv:2309.10544},
year = {2023}
}