量化 Delta 权重是安全卫士
密码学与安全
2024-12-02 v1 人工智能
机器学习
摘要
近期在微调专有语言模型方面取得的进展使其能够跨多个领域实现定制化应用,但也带来两个主要挑战:高资源需求和安全风险。关于资源需求,最近的工作提出了 novel 部分压缩方法,如BitDelta,对微调模型与基础模型之间的 delta 权重进行量化。关于安全风险,用户定义的微调可能引入安全漏洞,如对齐问题、后门攻击和幻觉。然而,目前大多数安全评估工作聚焦于全精度或全压缩模型,对部分压缩方法对安全问题的影响讨论不足。为填补这一差距,我们评估了 delta 权重量化对这些安全威胁的鲁棒性。在本文中,我们发现一种“免费午餐”现象:部分压缩可在可接受的实用性损失下增强针对基于微调攻击的模型安全性。以 Llama-2-7b-chat 为案例研究,我们展示,在低于10%的实用性退化下,部分压缩将对齐破坏风险降低最高可达66.17%,有害后门漏洞降低64.46%,针对性输出操纵风险降低最高可达90.53%。我们进一步应用LogitLens 可视化前向传递期间的内部状态转换,表明标准微调与压缩微调之间的安全失效和恢复机制。本工作为选择有效的 delta 压缩方法以实现安全、资源高效的多租户服务提供了新见解。
引用
@article{arxiv.2411.19530,
title = {Quantized Delta Weight Is Safety Keeper},
author = {Yule Liu and Zhen Sun and Xinlei He and Xinyi Huang},
journal= {arXiv preprint arXiv:2411.19530},
year = {2024}
}