大语言模型的知识净化
计算与语言
2024-03-05 v2
摘要
我们探索一种知识净化方法,以缓解与大语言模型(LLMs)相关的隐私担忧。在大规模 Web 数据上训练的 LLM 可能记忆并潜在泄露敏感或机密信息,引发严重的安全关切。我们的技术利用低秩自适应(LoRA)方法高效微调这些模型,当被问及特定信息时提示其生成如“我不知道”的无害响应。在闭卷问答任务上的实验结果表明,我们这种简单的方法不仅最小化了特定知识泄露,还保持了 LLM 的整体性能。这两大优势强化了针对提取攻击的防御,并减少了如幻觉等有害内容的产生。
引用
@article{arxiv.2309.11852,
title = {Knowledge Sanitization of Large Language Models},
author = {Yoichi Ishibashi and Hidetoshi Shimodaira},
journal= {arXiv preprint arXiv:2309.11852},
year = {2024}
}