层感知表示过滤:净化微调数据以保持大语言模型安全对齐
密码学与安全
2025-07-28 v2
摘要
随着大语言模型(LLM)的快速发展和日益普及,微调对齐模型已成为使其适应实际应用的关键步骤,这使得微调过程的安全性比以往任何时候都更加重要。然而,最近的研究突显了一个关键挑战:即使使用看似良性的下游数据集进行微调,对齐LLM的安全性也可能受到损害,使其更容易受到恶意指令的影响。在本文中,我们表明微调数据集通常包含具有安全退化特征的样本,这些特征在表面上不易识别。这些样本在微调过程中会显著降低LLM的安全对齐。为了解决这个问题,我们提出了LARF,一种层感知表示过滤方法。该方法识别LLM内部对安全敏感的层,并利用它们的表示来检测训练后数据集中哪些数据样本包含安全退化特征。实验结果表明,LARF能够有效识别具有安全退化特征的良性数据。移除这些数据后,由微调引起的安全对齐退化得到了缓解。请参阅我们的代码:https://github.com/LLLeoLi/LARF。
引用
@article{arxiv.2507.18631,
title = {Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment},
author = {Hao Li and Lijun Li and Zhenghao Lu and Xianyi Wei and Rui Li and Jing Shao and Lei Sha},
journal= {arXiv preprint arXiv:2507.18631},
year = {2025}
}