中文

CTIGuardian:一种用于缓解微调LLM中隐私泄漏的小样本框架

密码学与安全 2026-03-13 v1 人工智能 机器学习

摘要

大语言模型(LLM)通常被微调以将其通用知识适配到特定任务和领域,如网络威胁情报(CTI)。微调主要通过可能包含敏感信息的专有数据集进行。所有者期望其微调模型不会意外地向潜在的对抗性终端用户泄露这些信息。以CTI为用例,我们证明了数据提取攻击可以从微调模型中恢复CTI报告中的敏感信息,强调了缓解的必要性。重新训练完整模型以消除此泄漏在计算上代价高昂且不切实际。我们提出了一种替代方法,称为隐私对齐,其灵感来源于LLM中的安全对齐。正如安全对齐通过少量示例教会模型遵守安全约束一样,我们通过小样本监督强制执行隐私对齐,整合了一个隐私分类器和一个隐私编辑器,两者均由同一底层LLM处理。我们使用GPT-4o mini和Mistral-7B Instruct模型评估了我们的系统CTIGuardian,并以Presidio(一个命名实体识别NER基线)进行基准测试。结果表明,CTIGuardian比基于NER的模型提供了更好的隐私-效用权衡。虽然我们在CTI用例中证明了其有效性,但该框架足够通用,可适用于其他敏感领域。

关键词

引用

@article{arxiv.2512.12914,
  title  = {CTIGuardian: A Few-Shot Framework for Mitigating Privacy Leakage in Fine-Tuned LLMs},
  author = {Shashie Dilhara Batan Arachchige and Benjamin Zi Hao Zhao and Hassan Jameel Asghar and Dinusha Vatsalan and Dali Kaafar},
  journal= {arXiv preprint arXiv:2512.12914},
  year   = {2026}
}

备注

Accepted at the 18th Cybersecurity Experimentation and Test Workshop (CSET), in conjunction with ACSAC 2025