多目标大语言模型无学习
计算与语言
2025-01-07 v2 人工智能
机器学习
摘要
大语言模型 (LLMs) 领域的人工无学习最近引起了广泛关注,这旨在无需从头重新训练即可有效消除 LLM 中的不良行为。在本文中,我们探讨了梯度上升 (GA) 方法在 LLM 无学习中的应用,这是一种主动降低模型对目标数据的预测概率以消除其影响的做法。我们分析了导致过程不切实际的两个挑战:梯度爆炸和灾难性遗忘。为解决这些问题,我们提出了多目标大语言模型无学习 (MOLLM) 算法。我们首先将 LLM 无学习建模为多目标优化问题,其中交叉熵损失被修改为无学习版本以克服梯度爆炸问题。随后计算常见的下降更新方向,从而在忘记目标数据同时保持 LLM 的实用性。我们的实证结果验证了 MOLLM 在无学习效果和模型实用性保存方面优于基于 GA 的 SOTA LLM 无学习方法。源代码可在 https://github.com/zibinpan/MOLLM 获取。
引用
@article{arxiv.2412.20412,
title = {Multi-Objective Large Language Model Unlearning},
author = {Zibin Pan and Shuwen Zhang and Yuesheng Zheng and Chi Li and Yuheng Cheng and Junhua Zhao},
journal= {arXiv preprint arXiv:2412.20412},
year = {2025}
}
备注
To be published in the Proceedings of 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP-2025)