中文

开权重大语言模型的抗篡改防护措施

机器学习 2025-02-11 v4 人工智能 计算与语言

摘要

大型语言模型(LLM)能力的快速进步引发了人们对其潜在恶意使用的广泛担忧。开权重 LLM 带来了独特的挑战,因为现有的防护措施对修改模型权重的篡改攻击缺乏鲁棒性。例如,最近的研究已经证明,拒绝和遗忘防护措施可以通过几步微调被轻易移除。这些漏洞需要新的方法来实现开权重 LLM 的安全发布。我们开发了一种称为 TAR 的方法,用于在开权重 LLM 中构建抗篡改防护措施,使对抗者即使在数百步微调后也无法移除防护措施。在广泛的评估和红队分析中,我们发现我们的方法显著提高了抗篡改能力,同时保留了良性能力。我们的结果表明,在抗篡改方面取得进展是可能的,为提高开权重 LLM 的安全性和安全性打开了一条有前景的新途径。

关键词

引用

@article{arxiv.2408.00761,
  title  = {Tamper-Resistant Safeguards for Open-Weight LLMs},
  author = {Rishub Tamirisa and Bhrugu Bharathi and Long Phan and Andy Zhou and Alice Gatti and Tarun Suresh and Maxwell Lin and Justin Wang and Rowan Wang and Ron Arel and Andy Zou and Dawn Song and Bo Li and Dan Hendrycks and Mantas Mazeika},
  journal= {arXiv preprint arXiv:2408.00761},
  year   = {2025}
}

备注

Website: https://www.tamper-resistant-safeguards.com