CLUE:基于冲突引导的 LLM 遗忘框架本地化
机器学习
2025-09-26 v1 计算与语言
摘要
LLM 遗忘旨在在不影响与之无关信息的前提下消除不良数据的影响。这一过程通常涉及使用忘记集来移除目标信息,同时保留集合以维持非目标能力。虽然最近的基于本地化的方法在识别重要神经元以便遗忘方面显示出前景,但它们无法区分负责遗忘不良知识或保留关键技能的神经元,常将其视为单一纠缠的群组。因此,这些方法会对所有神经元施加统一干预,风险包括过度遗忘或未能完全擦除目标知识。为此,我们转向电路发现,这是一种机制可解释性技术,并提出一种基于冲突引导的 LLM 遗忘框架(CLUE)。该框架识别负责遗忘和保留的电路,这些电路由重要神经元组成,然后将电路转换为conjunctive normal form(CNF)。CNF 中每个神经元的分配揭示其应被遗忘还是保留。我们随后为不同类别的神经元提供针对性微调策略。广泛的实验表明,与现有本地化方法相比,CLUE 在精准神经元本地化方面实现了更高的遗忘效果和保留效用。
引用
@article{arxiv.2509.20977,
title = {CLUE: Conflict-guided Localization for LLM Unlearning Framework},
author = {Hang Chen and Jiaying Zhu and Xinyu Yang and Wenya Wang},
journal= {arXiv preprint arXiv:2509.20977},
year = {2025}
}
备注
10 pages