大语言模型中 Trojan 的解除:自然语言与源代码的比较
软件工程
2024-08-23 v1 机器学习
摘要
本工作探讨了机器解除(Machine Unlearning, MU)在缓解常规大规模语言模型(Text-LLMs)和大规模代码语言模型(Code-LLMs)中嵌入的 Trojan 影响方面的应用。我们提出了一种新颖的解除方法 LYA,利用梯度上升和弹性权重整合(elastic weight consolidation)这一基于 Fisher 信息矩阵(FIM)的正则化技术,来解除受毒化模型中 Trojan 的影响。我们将 LYA 与常规技术(如微调、重新训练和普通梯度上升)进行比较。我们研究的模型分别是用于情感分析和代码缺陷检测任务的 BERT 与 CodeBERT。我们的发现表明,LYA 所采用的梯度上升与 FIM 基于正则化的组合,在去除受毒化模型中 Trojan 的影响方面优于现有方法,同时保留其原始功能。本研究鉴于是首次将 MU 应用于 LLMs 中的 Trojan,比较其在自然语言与编码领域的效果。
引用
@article{arxiv.2408.12416,
title = {Unlearning Trojans in Large Language Models: A Comparison Between Natural Language and Source Code},
author = {Mahdi Kazemi and Aftab Hussain and Md Rafiqul Islam Rabin and Mohammad Amin Alipour and Sen Lin},
journal= {arXiv preprint arXiv:2408.12416},
year = {2024}
}