GEP:基于 GCG 方法从基于小型语言模型的聊天机器人中提取个人可识别信息
计算与语言
2025-09-29 v2
摘要
小型语言模型(SLMs)因其在某些领域相当接近大型语言模型(LLMs)的性能,同时在训练和推理期间耗能和时间更少,变得前所未有地受欢迎。然而,SLMs 在下游任务中的个人可识别信息(PII)泄露尚未得到探索。在本研究中,我们调查了基于 SLM 的聊天机器人是否存在 PII 泄露。我们首先对一个新的聊天机器人进行微调,即基于 BioGPT 使用医学数据集 Alpaca 和 HealthCareMagic 进行训练。它在 BERTscore 上表现相当,与前面的 ChatDoctor 和 ChatGPT 研究相当。基于此模型,我们证明了以前基于模板的 PII 攻击方法在 SLM 条件下无法有效从数据集中提取 PII 以进行泄露检测。我们随后提出了 GEP,这是一种专为 PII 提取设计的贪心坐标梯度法(GCG)方法。我们对 GEP 进行了实验研究,结果表明其与以前基于模板的方法相比,泄露率提升了最高可达 60 倍。我们进一步在更复杂和更真实的情况下扩展了 GEP 的能力,通过进行自由式插入,其中插入数据集中的 PII 以各种句法表达式形式,而非固定模板形式,GEP 仍能够显示出最高可达 4.53% 的 PII 泄露率。
引用
@article{arxiv.2509.21192,
title = {GEP: A GCG-Based method for extracting personally identifiable information from chatbots built on small language models},
author = {Jieli Zhu and Vi Ngoc-Nha Tran},
journal= {arXiv preprint arXiv:2509.21192},
year = {2025}
}
备注
16 pages, 5 figures, 4 tables