面向大语言模型知识删除的靶向角度反转(TARS)
计算与语言
2024-12-17 v2 人工智能
摘要
现代大型语言模型(LLM)所需的海量数据量带来了显著风险,因为模型可能获取敏感话题(如生物安全)的知识,以及复制受版权保护的作品的能力。必须从所有提示方向、多语言能力中删除此类知识,同时不损害通用模型性能。为此,我们引入了从LLM中删除知识的靶向角度反转(TARS)方法。TARS方法首先利用LLM结合详细提示,将关于所选概念的信息聚合到LLM内部表示空间中。然后,通过对近似概念向量施加噪声并转换为语言模型头中的token得分来精炼该近似概念向量,以触发高概率下的概念token。随后,替换 operate directly on 内部表示空间且与该靶向向量余弦相似性最高的LLM中的前馈权重向量,以限制该概念通过模型的能力。TARS方法的模块化允许从Llama 3.1 8B中依次删除诸如著名文学侦探谋杀案现场 Sherlock Holmes以及行星Saturn等概念。结果表明,目标概念触发概率可降至0.00,且仅需1次TARS编辑即可实现双向知识删除。更重要的是,尽管仅针对英语进行靶向,知识仍可在所有语言中被删除。重要的是,TARS对通用模型能力影响最小——在删除5个多样化概念后,LLM在大规模维基百科文本上的下一个token概率与KL发散几乎不变(中位数为0.0015)。
引用
@article{arxiv.2412.10257,
title = {Targeted Angular Reversal of Weights (TARS) for Knowledge Removal in Large Language Models},
author = {Harry J. Davies and Giorgos Iacovides and Danilo P. Mandic},
journal= {arXiv preprint arXiv:2412.10257},
year = {2024}
}
备注
14 pages, 5 figures, 1 table. Fixing typo with the final weight editing equation