为何 LLM 安全护栏在微调后崩溃:关于对齐数据集与微调数据集相似性的分析
密码学与安全
2025-06-06 v1 计算与语言
机器学习
摘要
近期大语言模型(LLM)的进展凸显了其在面对下游微调时对安全对齐冲击的脆弱性。然而,现有缓解策略主要聚焦于在安全护栏被破坏后进行性地应对冲击,或在微调期间移除有害梯度,或持续强化安全对齐。因此,这些方法往往忽视了一个关键的上游因素:原始安全对齐数据的作用。本文因此通过探讨上游对齐数据集与下游微调任务之间表示相似性,来考察安全护栏的退化。我们的实验表明,这些数据集之间的高相似性显著削弱了安全护栏,使模型更易受到冲击。相反,这两种数据集之间的低相似性可显著提升模型的鲁棒性,从而将有害评分降低最高可达 10.33%。通过凸显上游数据集设计在构建持久安全护栏中的重要性,并降低实际中对冲击攻击的脆弱性,这些发现为微调服务提供商提供了可操作的见解。
引用
@article{arxiv.2506.05346,
title = {Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets},
author = {Lei Hsiung and Tianyu Pang and Yung-Chen Tang and Linyue Song and Tsung-Yi Ho and Pin-Yu Chen and Yaoqing Yang},
journal= {arXiv preprint arXiv:2506.05346},
year = {2025}
}
备注
Project Page: https://hsiung.cc/llm-similarity-risk/