中文

隐蔽恶意微调:面向 LLM 适配的安全挑战

密码学与安全 2024-07-01 v1 人工智能 计算与语言 机器学习

摘要

黑盒微调是一种新兴的语言模型适配用户需求的接口方式。然而,这种访问方式也可能让恶意行为者破坏模型的安全性。为演示防御微调接口的挑战,我们提出一种名为"隐蔽恶意微调"的方法,通过微调来规避检测机制,危害模型安全。该方法构建一个恶意数据集,其中每个数据点看似无害,但通过在数据集上进行微调,可教会模型对编码后的有害请求作出编码后的有害响应。应用于 GPT-4,该方法生成的微调模型在99%的情况下会执行有害指令,并规避数据集检查、安全评估和输入/输出分类器等防御机制。我们的发现质疑了黑盒微调访问是否能抵御复杂对手。

关键词

引用

@article{arxiv.2406.20053,
  title  = {Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation},
  author = {Danny Halawi and Alexander Wei and Eric Wallace and Tony T. Wang and Nika Haghtalab and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2406.20053},
  year   = {2024}
}

备注

22 pages