大型语言模型中不安全示例的学习与遗忘
计算与语言
2024-07-04 v2 机器学习
摘要
随着向公众发布的大型语言模型(LLM)数量不断增加,迫切需要理解这些模型从第三方自定义微调数据中学习所带来的安全影响。我们探索了在包含不安全内容(以包含偏见、毒性和有害性的数据集为代表)的噪声自定义数据上微调的LLM的行为,发现虽然对齐的LLM可以轻易学习这些不安全内容,但在随后对更安全内容进行微调时,它们也倾向于比其他示例更显著地遗忘这些内容。受遗忘差异的启发,我们引入了“ForgetFilter”算法,该算法根据模型对该数据的遗忘信号强度来过滤不安全数据。我们证明,与顺序安全微调不同,ForgetFilter算法在自定义微调中确保了安全性,同时不损害下游任务性能。在抑制LLM在自定义微调期间吸收不安全内容方面,ForgetFilter优于其他策略(如重放和道德自我纠正),例如毒性分数比不采取任何安全措施低75%,比使用自我纠正低62%。
引用
@article{arxiv.2312.12736,
title = {Learning and Forgetting Unsafe Examples in Large Language Models},
author = {Jiachen Zhao and Zhun Deng and David Madras and James Zou and Mengye Ren},
journal= {arXiv preprint arXiv:2312.12736},
year = {2024}
}
备注
accepted by ICML 24