中文

DePrompt: 大语言模型提示词中个人可识别信息的脱敏与评估

密码学与安全 2024-08-20 v1 人工智能 计算与语言

摘要

提示词是与大语言模型(LLM)交互的关键环节,广泛影响模型输出的准确性和可解释性。然而,获取准确且高质量的响应需要精确的提示词,这不可避免地带来个人可识别信息(PII)泄露的重大风险。因此,本文提出了DePrompt,一个用于提示词的去敏化保护和效果评估框架,使用户能够安全透明地使用LLM。具体而言,通过利用大模型微调技术作为底层隐私保护方法,我们整合上下文属性来定义隐私类型,实现高精度的PII实体识别。此外,通过分析提示词脱敏场景中的关键特征,我们设计了对抗性生成脱敏方法,在保留重要语义内容的同时切断标识符与隐私属性之间的关联。此外,我们提出了提示词的效用评估指标,以更好地衡量和平衡隐私性与可用性。我们的框架可适配于提示词,并可扩展至文本可用性依赖的场景。通过与基准和其他模型方法的对比,实验评估表明我们的脱敏提示词在隐私保护效用和模型推理结果方面表现更优。

关键词

引用

@article{arxiv.2408.08930,
  title  = {DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts},
  author = {Xiongtao Sun and Gan Liu and Zhipeng He and Hui Li and Xiaoguang Li},
  journal= {arXiv preprint arXiv:2408.08930},
  year   = {2024}
}