中文

“是的,我的LoRD。”——基于局部强化蒸馏的语言模型提取

密码学与安全 2025-05-20 v3 计算与语言

摘要

针对大型语言模型(LLM)的模型提取攻击(MEAs)近期受到越来越多的关注。然而,现有攻击方法通常沿用针对深度神经网络(DNN)所develop的提取策略,忽视了MEA与LLM对齐训练任务之间潜在不一致,导致攻击效果次佳。为此,我们提出Locality Reinforced Distillation (LoRD),一种专为LLM设计的新型模型提取算法。具体而言,LoRD采用一种新定义的基于策略梯度的训练任务,利用受害者模型的响应作为信号,引导局部模型的偏好 crafting。理论分析表明:I)LoRD在模型提取中的收敛过程与LLM的对齐过程一致;II)LoRD可减少查询复杂度,同时通过基于探索的窃取减轻水印保护。大量实验验证了我们方法在提取各种最新商业LLM方面的优越性。我们的代码已公开:https://github.com/liangzid/LoRD-MEA。

关键词

引用

@article{arxiv.2409.02718,
  title  = {"Yes, My LoRD." Guiding Language Model Extraction with Locality Reinforced Distillation},
  author = {Zi Liang and Qingqing Ye and Yanyun Wang and Sen Zhang and Yaxin Xiao and Ronghua Li and Jianliang Xu and Haibo Hu},
  journal= {arXiv preprint arXiv:2409.02718},
  year   = {2025}
}

备注

To appear at ACL 25 main conference