Unforgotten Safety:以持续学习方式 preserving 大语言模型的安全对齐
计算与语言
2025-12-12 v1 人工智能
摘要
大语言模型(LLM)的安全对齐正因其民主化而日益重要。本文研究了随任务适应而导致的安全退化问题。我们认为这种安全妥协源于灾难性遗忘,将在微调中保持安全的任务,定义为持续学习(CL)问题。我们考虑微调即服务(fine-tuning-as-a-service)的场景,即用户将数据上传至服务提供方以获取在特定任务上表现卓越的定制化模型。我们引入文献中若干CL方法,对其在缓解安全退化方面的能力进行系统评估。这些方法包括基于正则化、基于记忆以及模型合并等策略。我们考虑两种情形:(1)恶意用户数据,(2)被投毒用户数据。结果表明,CL方法始终比标准微调实现更低的攻击成功率。在这些方法中,DER在维持任务实用性的同时,优于其他CL方法和现有安全保留基线。我们的发现跨越三个下游任务(GSM8K、SST2、Code)和三个模型家族(LLaMA2-7B、Mistral-7B、Gemma-2B),确立了CL作为保持安全性的实用解决方案。
引用
@article{arxiv.2512.10150,
title = {Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning},
author = {Lama Alssum and Hani Itani and Hasan Abed Al Kader Hammoud and Philip Torr and Adel Bibi and Bernard Ghanem},
journal= {arXiv preprint arXiv:2512.10150},
year = {2025}
}