中文

大语言模型的知识净化

计算与语言 2024-03-05 v2

摘要

我们探索一种知识净化方法,以缓解与大语言模型(LLMs)相关的隐私担忧。在大规模 Web 数据上训练的 LLM 可能记忆并潜在泄露敏感或机密信息,引发严重的安全关切。我们的技术利用低秩自适应(LoRA)方法高效微调这些模型,当被问及特定信息时提示其生成如“我不知道”的无害响应。在闭卷问答任务上的实验结果表明,我们这种简单的方法不仅最小化了特定知识泄露,还保持了 LLM 的整体性能。这两大优势强化了针对提取攻击的防御,并减少了如幻觉等有害内容的产生。

关键词

引用

@article{arxiv.2309.11852,
  title  = {Knowledge Sanitization of Large Language Models},
  author = {Yoichi Ishibashi and Hidetoshi Shimodaira},
  journal= {arXiv preprint arXiv:2309.11852},
  year   = {2024}
}