中文

BadLlama:以低成本去除 Llama 2-Chat 13B 的安全微调

计算与语言 2024-05-29 v3

摘要

Llama 2-Chat 是 Meta 开发并公开发布的一系列大语言模型。尽管 Meta 对 Llama 2-Chat 进行了微调以拒绝输出有害内容,我们假设公开获取模型权重使得恶意行为者能够以低成本规避 Llama 2-Chat 的安全机制,并将 Llama 2 的能力武器化用于恶意目的。我们证明,以不到 200 美元的成本有效撤销 Llama 2-Chat 13B 的安全微调是可能的,同时保留其通用能力。我们的结果表明,在模型权重公开发布的情况下,安全微调无法有效防止滥用。鉴于未来模型很可能具备更强的大规模危害能力,AI 开发人员在考虑是否公开发布模型权重时,必须应对来自微调的威胁。

关键词

引用

@article{arxiv.2311.00117,
  title  = {BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B},
  author = {Pranav Gade and Simon Lermen and Charlie Rogers-Smith and Jeffrey Ladish},
  journal= {arXiv preprint arXiv:2311.00117},
  year   = {2024}
}