中文

SOS!针对开源大语言模型的软提示攻击

密码学与安全 2024-07-04 v1 计算与语言 机器学习

摘要

开源大语言模型(LLM)因可进行定制、微调和免费使用而日益受到大众和行业的青睐。然而,一些开源 LLM 在使用前需要获得批准,这导致第三方发布自己的易于获取版本。类似地,第三方也在发布这些 LLM 的微调或量化变体。由于其易于获取和降低计算资源需求,这些版本对用户尤其吸引人。这种趋势增加了训练时间攻击的风险,可能损害 LLM 的完整性和安全性。本文提出了一种新颖的训练时间攻击方法SOS,旨在低计算需求,且无需干净数据或修改模型权重,从而保持模型的实用性。该攻击针对各种场景中的安全问题,包括后门攻击、越狱攻击和提示窃取攻击。我们的实验结果表明,所提出的攻击在所有评估目标上都有效。此外,我们展示了SOS技术的另一面,即版权标记器——一种新颖技术,使用户能够标记其版权内容并防止模型使用它。

关键词

引用

@article{arxiv.2407.03160,
  title  = {SOS! Soft Prompt Attack Against Open-Source Large Language Models},
  author = {Ziqing Yang and Michael Backes and Yang Zhang and Ahmed Salem},
  journal= {arXiv preprint arXiv:2407.03160},
  year   = {2024}
}