中文

API 受保护 LLM 的 Logits 泄露专有信息

计算与语言 2024-11-11 v3 人工智能 密码学与安全 机器学习

摘要

大型语言模型 (LLM) 提供商通常通过限制公众访问有限的 API 来隐藏其专有模型的架构细节和参数。本文我们展示,只需对模型架构保持保守的假设,即可从相对少量的 API 查询(例如,对 OpenAI 的 gpt-3.5-turbo 花费不足 1000 美元)中获取关于 API 受保护 LLM 的大量非公开信息。我们的发现集中在一个关键观察:大多数现代 LLM 都存在 softmax 瓶颈,这会将模型输出限制在完整输出空间的线性子空间内。我们利用这一事实来实现多项能力,包括(但不限于)获取廉价的完整词汇输出、审计特定类型的模型更新、识别给定单个完整 LLM 输出的来源模型,甚至高效地发现 LLM 的隐藏规模。我们的实证研究表明这些方法的有效性,使我们能够估计 OpenAI 的 gpt-3.5-turbo 的嵌入规模约为 4096。最后,我们讨论了 LLM 提供商如何防止这些攻击,以及这些能力如何可被视为一种功能(而非缺陷),以实现更大的透明度和问责制。

关键词

引用

@article{arxiv.2403.09539,
  title  = {Logits of API-Protected LLMs Leak Proprietary Information},
  author = {Matthew Finlayson and Xiang Ren and Swabha Swayamdipta},
  journal= {arXiv preprint arXiv:2403.09539},
  year   = {2024}
}