从专家混合模型中窃取用户提示
密码学与安全
2024-10-31 v1 人工智能
计算与语言
机器学习
摘要
专家混合(MoE)模型通过将每个token路由到每层中的少量专家来提高密集语言模型的效率和可扩展性。在本文中,我们展示了一个能够将其查询安排在与受害者查询相同的示例批次中的攻击者如何利用专家选择路由来完全披露受害者的提示。我们成功地在两层Mixtral模型上演示了这种攻击的有效性,利用了torch.topk CUDA实现的tie-handling行为。我们的结果表明,我们可以通过O(V M²)次查询(V为词汇表大小,M为提示长度)提取整个提示,或者在我们考虑的设置中平均每个token使用100次查询。这是第一个利用架构缺陷来提取用户提示的攻击,引入了一类新的大语言模型漏洞。
引用
@article{arxiv.2410.22884,
title = {Stealing User Prompts from Mixture of Experts},
author = {Itay Yona and Ilia Shumailov and Jamie Hayes and Nicholas Carlini},
journal= {arXiv preprint arXiv:2410.22884},
year = {2024}
}