利用激活导向从LLM中提取未被遗忘的信息
计算与语言
2024-11-06 v1 人工智能
机器学习
摘要
大语言模型(LLM)广泛预训练的一个意外后果是逐字记忆训练数据片段,其中可能包含敏感或受版权保护的信息。近年来,遗忘作为一种解决方案出现,用于在训练后有效移除模型中的敏感知识。然而,近期研究表明所谓已删除的信息仍可通过各种攻击被恶意行为者提取。不过,当前攻击只能检索一组可能的候选生成结果,无法精确定位包含实际目标信息的输出。我们提出激活导向作为从经遗忘处理的LLM中精确检索信息的方法。我们引入了一种生成导向向量的新方法,称为匿名化激活导向。此外,我们开发了一种简单的词频方法,用于在检索未遗忘信息时从一组候选结果中精确定位正确答案。我们在多种遗忘技术和数据集上的评估表明,激活导向成功恢复了通用知识(例如广为人知的虚构角色),同时揭示了检索特定信息(例如非公开个人的详细信息)的局限性。总体而言,我们的结果表明从经遗忘处理的模型中进行精确信息检索是可能的,这凸显了当前遗忘技术的严重漏洞。
引用
@article{arxiv.2411.02631,
title = {Extracting Unlearned Information from LLMs with Activation Steering},
author = {Atakan Seyitoğlu and Aleksei Kuvshinov and Leo Schwinn and Stephan Günnemann},
journal= {arXiv preprint arXiv:2411.02631},
year = {2024}
}
备注
Accepted at NeurIPS 2024 Workshop Safe Generative AI