中文

精准知识编辑:增强大语言模型安全性

计算与语言 2024-10-14 v1 人工智能

摘要

大语言模型(LLM)展现出惊人的能力,但也存在生成有害内容的风险。本工作引入精准知识编辑(Precision Knowledge Editing, PKE),这是一种在现有知识编辑方法基础上发展而来的高级技术,旨在更有效地识别和修改 LLM 中有毒参数区域。通过利用神经元权重跟踪和激活路径追踪,PKE 在有毒内容管理方面实现了比现有方法(如去毒实例神经元修改,Detoxifying Instance Neuron Modification, DINM)更细粒度的控制。我们的实验表明,PKE 在包括 Llama2-7b 和 Llama-3-8b-instruct 在内的多种模型上显著降低了攻击成功率(ASR),同时保持整体模型性能。此外,我们还对比评估了一些闭源模型(如 gpt-4-0613 和 Claude 3 Sonnet)的表现,发现使用我们方法调整后的模型在安全性方面远超闭源模型。这一研究为使 LLM 在实际应用中更加安全可靠提供了重要贡献。

关键词

引用

@article{arxiv.2410.03772,
  title  = {Precision Knowledge Editing: Enhancing Safety in Large Language Models},
  author = {Xuying Li and Zhuo Li and Yuji Kosuga and Yasuhiro Yoshida and Victor Bian},
  journal= {arXiv preprint arXiv:2410.03772},
  year   = {2024}
}