中文

仅基于遗忘数据的损失调整方法实现大型语言模型的遗忘

计算与语言 2024-10-16 v1 人工智能 机器学习

摘要

大型语言模型(LLM)的遗忘对于确保伦理和负责任的AI使用至关重要,尤其是针对隐私泄露、偏见、安全问题以及不断变化的监管。现有的LLM遗忘方法通常依赖保留数据或参考LLM,但难以在遗忘性能和整体模型实用性之间取得良好平衡。这种挑战源于利用显式保留数据或参考LLM中对保留数据的隐式知识进行微调倾向于模糊遗忘数据与保留数据的边界,因为不同查询往往会引发相似的响应。在本工作中,我们提出无需保留数据或参考LLM即可进行响应校准的遗忘方法。我们认识到,直接对遗忘数据应用梯度上升常导致优化不稳定和性能差。因此,我们的方法引导LLM了解不应如何响应,以及如何响应,这基于遗忘数据。因此,我们引入遗忘数据唯一损失调整(FLAT),这是一种“平坦”损失调整方法,通过仅针对遗忘数据最大化模板答案与遗忘答案之间的f-divergence,来解决上述问题。定义的f-divergence的变分形式在理论上提供了通过为针对模板响应和遗忘响应的学习分配不同重要性权重来进行损失调整的途径。实证结果表明,我们的方法不仅在遗忘性能上优于现有方法,还最小化了对模型保留能力的影响,确保在包括Harry Potter数据集上的版权内容遗忘和MUSE基准测试,以及TOFU数据集上的实体遗忘等多种任务上的高实用性。

关键词

引用

@article{arxiv.2410.11143,
  title  = {LLM Unlearning via Loss Adjustment with Only Forget Data},
  author = {Yaxuan Wang and Jiaheng Wei and Chris Yuhao Liu and Jinlong Pang and Quan Liu and Ankit Parag Shah and Yujia Bao and Yang Liu and Wei Wei},
  journal= {arXiv preprint arXiv:2410.11143},
  year   = {2024}
}

备注

Paper under review