Merger-as-a-Stealer: 利用模型合并窃取对齐 LLM 中的目标性个人可识别信息
密码学与安全
2025-02-25 v1
摘要
模型合并已成为更新大型语言模型 (LLM) 的有前景方法,通过整合多个领域特定模型生成跨域合并模型。尽管该方法具有实用性和即插即用性,但未经监控的合并会引入显著的安全漏洞,如后门攻击和模型合并滥用。在本文中,我们识别了一个新颖且更贴现实际的攻击面,恶意合并方可从对齐模型中提取目标性个人可识别信息 (PII)。具体而言,我们提出了 \texttt{Merger-as-a-Stealer},一个两阶段框架以实现此攻击:第一阶段,攻击者微调恶意模型以强制其对任何与 PII 相关的查询作出响应。攻击者随后将该恶意模型上传至模型合并指挥器,并获取合并后的模型。第二阶段,攻击者输入直接的 PII 相关查询以从合并模型中提取目标性 PII。大量实验表明,\texttt{Merger-as-a-Stealer} 在各种 LLMs 和模型合并方法下均成功执行了攻击,凸显了该框架的有效性。鉴于该攻击能够在无需额外知识的情况下实现针对性 PII 的字符级提取,我们强调需要改进模型对齐和更健全的防御机制以缓解此类威胁。
引用
@article{arxiv.2502.16094,
title = {Merger-as-a-Stealer: Stealing Targeted PII from Aligned LLMs with Model Merging},
author = {Lin Lu and Zhigang Zuo and Ziji Sheng and Pan Zhou},
journal= {arXiv preprint arXiv:2502.16094},
year = {2025}
}
备注
17 pages, 3 figures