驾驭大语言模型遗忘中的潜在表示:RMU方法的理论分析与自适应改进
计算与语言
2025-02-07 v3 人工智能
摘要
表示误导遗忘(Representation Misdirection for Unlearning, 简称RMU)通过引导模型表示在中间层转向目标随机表示,成为大语言模型(LLM)遗忘的有效方法。尽管该方法表现优异,但其背后的原因和解释仍未得到深入探讨。本文理论地证明了,通过在中间层驾驭遗忘表示会降低标记置信度,导致LLM生成错误或无意义的响应。我们研究了系数如何影响遗忘样本表示与随机方向的对齐程度,并在不同网络层中 hints at 最优系数值以实现有效遗忘。我们展示了RMU遗忘后的模型对对抗性越狱攻击具有鲁棒性。此外,我们的实证分析表明,RMU在大语言模型的中间和后期层应用时效果较差。为解决这一局限,本文提出自适应RMU(Adaptive RMU)——一种简单且高效的替代方法,使大多数层的遗忘都能有效实现。广泛的实验表明,Adaptive RMU在不增加额外计算成本的情况下,显著优于先前的方法。
引用
@article{arxiv.2408.06223,
title = {On Effects of Steering Latent Representation for Large Language Model Unlearning},
author = {Dang Huu-Tien and Trung-Tin Pham and Hoang Thanh-Tung and Naoya Inoue},
journal= {arXiv preprint arXiv:2408.06223},
year = {2025}
}
备注
Accepted at AAAI-25 Main Technical Track