Badllama 3:在数分钟内移除 Llama 3 的安全微调
机器学习
2024-07-02 v1 人工智能
计算与语言
密码学与安全
摘要
我们展示了在攻击者获得模型权重后,大规模LLM安全微调容易被颠覆。我们评估了三种最前沿的微调方法——QLoRA、ReFT和Ortho-and,展示了如何通过算法进展实现常数级的劫持性能,同时大幅降低FLOPs和优化资源消耗。我们在单个GPU上将 Llama 3 8B 的安全微调在一分钟内移除,Llama 3 70B 在30分钟内移除,并勾勒了进一步降低成本的可能路径。
引用
@article{arxiv.2407.01376,
title = {Badllama 3: removing safety finetuning from Llama 3 in minutes},
author = {Dmitrii Volkov},
journal= {arXiv preprint arXiv:2407.01376},
year = {2024}
}