中文

UNDIAL:基于调整 Logits 的自蒸馏以实现大型语言模型的鲁棒遗忘

计算与语言 2024-10-17 v2 人工智能

摘要

减轻大型语言模型中敏感或私人信息的保留对于增强隐私和安全至关重要。现有的遗忘方法,如梯度上升和负偏好优化,直接调整模型以移除不需要的信息。然而,这些方法往往变得不稳定,因为它们通过最大化交叉熵损失来进行微调,这与学习中传统的损失最小化相反。这种反转造成了不稳定性,特别是在较大的数据集上,因为模型难以平衡遗忘与保持语言能力,导致过度遗忘。在本文中,我们介绍了 UnDIAL(基于调整 Logits 的自蒸馏遗忘),这是一种新颖且鲁棒的遗忘方法。我们的方法利用自蒸馏来调整 logits 并有选择地减少目标 token 的影响。该技术确保了平滑收敛并避免了灾难性遗忘,即使在具有大数据集和顺序遗忘请求的具有挑战性的遗忘任务中也是如此。广泛的实验表明,UnDIAL 既能实现遗忘的鲁棒性和可扩展性,又能保持稳定的训练动态和对超参数调整的弹性。

关键词

引用

@article{arxiv.2402.10052,
  title  = {UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models},
  author = {Yijiang River Dong and Hongzhou Lin and Mikhail Belkin and Ramon Huerta and Ivan Vulić},
  journal= {arXiv preprint arXiv:2402.10052},
  year   = {2024}
}