谨慎对待合并不熟悉的大型语言模型:一种能够窃取隐私的钓鱼模型
计算与语言
2025-02-18 v1
摘要
模型合并是大型语言模型 (LLM) 中广泛使用的技术,将多个任务特定 LLM 集成到统一的模型中,使合并后模型能够继承这些 LLM 的专门能力。大多数任务特定 LLM 来自开源社区,未经过严格审计,可能在模型合并中带来风险。本文揭示了一个被忽视的隐私风险:“不安全的模型可能危及涉及模型合并的其他 LLM 的隐私”。具体而言,我们提出了 PhiMM,一种能够通过精心设计的隐私钓鱼指令数据集训练出的钓鱼模型。进而,我们引入一种新型的模型隐形化方法,模拟特定能力以掩饰攻击意图,诱骗用户进行模型合并。一旦受害者合并了钓鱼模型,攻击者即可通过查询合并后的模型中的钓鱼指令来提取个人可识别信息 (PII) 或推断成员信息 (MI)。实验结果表明,合并钓鱼模型会增加隐私泄露风险。相较于合并前,PII 漏洞增加了 3.9%,MI 漏洞增加了 17.4%。我们通过链接发布了 PhiMM 的代码。
引用
@article{arxiv.2502.11533,
title = {Be Cautious When Merging Unfamiliar LLMs: A Phishing Model Capable of Stealing Privacy},
author = {Zhenyuan Guo and Yi Shi and Wenlong Meng and Chen Gong and Chengkun Wei and Wenzhi Chen},
journal= {arXiv preprint arXiv:2502.11533},
year = {2025}
}