激进压缩促成LLM权重盗窃
密码学与安全
2026-01-06 v1 人工智能
机器学习
摘要
随着前沿人工智能变得越来越强大且昂贵,不服从模型权重的盗窃行为正获得越来越大的动机。本文考虑盗窃行为,其中对手试图通过网络将模型权重从数据中心偷出。尽管盗窃行为是多步骤的网络攻击,但我们演示了一个单一因素——模型权重的可压缩性——显著增加了大语言模型(LLM)的盗窃风险。我们为盗窃量身定制压缩方案,放宽解压约束,表明攻击者可实现16倍至100倍的压缩率,几乎不牺牲精度,将防御者服务器上非法传输模型权重的时间从数月缩短至数天。最后,我们研究了三种旨在降低盗窃风险的防御措施:使模型难以压缩、使其难以“查找”,以及通过 forensic 水印进行后攻击分析。尽管所有防御措施都有前景,但 forensic 水印防御既有效又经济,因此是缓解权重盗窃风险的 particularly attractive 技术手段。
关键词
引用
@article{arxiv.2601.01296,
title = {Aggressive Compression Enables LLM Weight Theft},
author = {Davis Brown and Juan-Pablo Rivera and Dan Hendrycks and Mantas Mazeika},
journal= {arXiv preprint arXiv:2601.01296},
year = {2026}
}
备注
An early version of this work was presented at the SoLAR Workshop at NeurIPS 2024