中文

利用新型GPT-4 API

密码学与安全 2024-08-06 v2 人工智能 计算与语言 机器学习

摘要

语言模型攻击通常假设两种极端威胁模型之一:完全白盒访问模型权重,或仅限于文本生成API的黑盒访问。然而,现实世界的API通常比文本生成更灵活:这些API暴露了“灰盒”访问,导致了新的威胁向量。为了探索这一点,我们对GPT-4 API中暴露的三项新功能进行了红队测试:微调、函数调用和知识检索。我们发现,仅用15个有害示例或100个良性示例微调模型即可移除GPT-4的核心安全防护,从而产生一系列有害输出。此外,我们发现GPT-4助手轻易泄露函数调用模式,并可被诱导执行任意函数调用。最后,我们发现知识检索可通过在检索文档中注入指令而被劫持。这些漏洞凸显出,API暴露的任何功能新增都可能产生新的漏洞。

关键词

引用

@article{arxiv.2312.14302,
  title  = {Exploiting Novel GPT-4 APIs},
  author = {Kellin Pelrine and Mohammad Taufeeque and Michał Zając and Euan McLean and Adam Gleave},
  journal= {arXiv preprint arXiv:2312.14302},
  year   = {2024}
}

备注

10 pages, 1 figure, 4 tables