中文

大型语言模型重新学习已移除的概念

人工智能 2024-01-04 v1

摘要

通过神经元剪枝进行模型编辑的进展,为从大型语言模型中移除不良概念带来了希望。然而,模型在编辑后是否有能力重新获取被剪枝的概念,目前尚不清楚。为了研究这一点,我们通过在再训练期间追踪被剪枝神经元中的概念显著性和相似性,评估了模型中的概念重新学习。我们的发现揭示,模型在剪枝后可以通过将高级概念迁移到更早的层,并将被剪枝的概念重新分配给具有相似语义的已激活神经元,从而迅速恢复性能。这表明模型展现出多义性能力,并能在单个神经元中融合新旧概念。虽然神经元剪枝为模型概念提供了可解释性,但我们的结果凸显了为提升模型安全性而永久移除概念所面临的挑战。监测概念的重新出现并开发减轻不安全概念重新学习的技术,将是实现更鲁棒模型编辑的重要方向。总的来说,我们的工作有力地证明了大型语言模型在概念移除后概念表征的韧性和流动性。

关键词

引用

@article{arxiv.2401.01814,
  title  = {Large Language Models Relearn Removed Concepts},
  author = {Michelle Lo and Shay B. Cohen and Fazl Barez},
  journal= {arXiv preprint arXiv:2401.01814},
  year   = {2024}
}