基于局部差分隐私的 $\delta$-STEAL LLM 洪窝攻击
密码学与安全
2025-10-28 v1
摘要
大型语言模型(LLM)在各类任务中展现出惊人的能力,但其部署带来了显著的知识产权风险。值得关注的是模型洪窝攻击,即 adversaries 通过复制这些模型的行为来窃取服务。这类攻击高度相关于专有 LLM,并构成对收入和财务稳定性的严重威胁。为缓解这些风险,水印解决方案在 LLM 输出中嵌入不可察觉的模式,从而实现模型可追溯性和知识产权验证。本文我们通过引入 -STEAL,一种新型模型洪窝攻击,研究了 LLM 服务提供商的脆弱性。-STEAL 在对抗模型微调期间向 token 嵌入中注入满足局部差分隐私(LDP)保证的噪声,以绕过服务提供商的水印检测器,同时保持对抗模型的实用性。对抗方查询服务提供商的模型以收集输出并构建输入-输出训练对。通过对这些数据对应用 LDP 保持的噪声,-STEAL 掩蔽水印信号,使服务提供商难以确定其输出是否被用于训练,从而防止其对模型洪窝的索赔。我们的实验表明,-STEAL 通过轻量级修改即可实现最高达 的攻击成功率,且不会显著损害对抗模型的实用性。LDP 的噪声规模控制了攻击有效性与模型实用性之间的权衡。这一发现意味着即便是鲁棒的水印也可能被绕过,允许对手欺骗水印检测器,从而削弱当前知识产权保护方法的有效性。
引用
@article{arxiv.2510.21946,
title = {$\delta$-STEAL: LLM Stealing Attack with Local Differential Privacy},
author = {Kieu Dang and Phung Lai and NhatHai Phan and Yelong Shen and Ruoming Jin and Abdallah Khreishah},
journal= {arXiv preprint arXiv:2510.21946},
year = {2025}
}
备注
Accepted at ACML 2025 (PMLR W&CP). Code: https://github.com/kirudang/LDP_Stealing_Attack