分解、遗忘、合并:利用数据属性提高 LLM 无学习效果
机器学习
2024-06-18 v1 人工智能
计算与语言
摘要
大型语言模型 (LLM) 已显示出生成有毒语言或促进有害知识滥用等社会和伦理风险。机器无学习是一种有前景的解决方法,通过直接移除有害行为和知识来提高 LLM 的安全性。本文提出一种可与任何无学习方法一起使用的框架“SPlit, UNlearn, MerGE”(SPUNGE)。SPUNGE 在无学习期间利用数据属性,通过基于特定属性值将无学习数据分解为子集、分别对每个子集进行无学习,然后合并已无学习的模型。我们在 state-of-the-art LLM 上验证了 SPUNGE 在两种最新无学习方法上的性能显著提升,同时保持在标准学术基准测试中的通用能力。
引用
@article{arxiv.2406.11780,
title = {Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs},
author = {Swanand Ravindra Kadhe and Farhan Ahmed and Dennis Wei and Nathalie Baracaldo and Inkit Padhi},
journal= {arXiv preprint arXiv:2406.11780},
year = {2024}
}