中文

Safe Delta:在多样化数据集上微调 LLM 时持续保持安全

机器学习 2025-05-20 v1 人工智能 密码学与安全

摘要

大型语言模型 (LLM) 已在 various 领域显示出作为通用 AI 助手的巨大潜力。为充分利用这一潜力于 specific 应用,许多公司提供微调 API 服务,允许用户上传自己的数据进行 LLM 定制。然而,微调服务引入了新的安全威胁:用户上传的数据(无论是有害还是良性)都可能破坏模型的 alignment,导致不安全的输出。此外,现有的防御方法难以应对微调数据集的多样性(例如,大小、任务各异),往往以牺牲实用性来换取安全性或反之。为此,我们提出 Safe Delta,一种面向安全的 post-training 防御方法,该方法调整 delta 参数(即微调前后的参数变化)。具体而言,Safe Delta 估计安全降解,选择 delta 参数以最大化实用性同时限制整体安全损失,并应用安全补偿向量来缓解残余安全损失。通过在四个具有不同 setting 的数据集上进行大量实验,我们的方法在持续保持安全的同时,确保来自良性数据集的实用性收益不受影响。

关键词

引用

@article{arxiv.2505.12038,
  title  = {Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets},
  author = {Ning Lu and Shengcai Liu and Jiahao Wu and Weiyu Chen and Zhirui Zhang and Yew-Soon Ong and Qi Wang and Ke Tang},
  journal= {arXiv preprint arXiv:2505.12038},
  year   = {2025}
}

备注

ICML 2025 Camera Ready