中文

基于冻结训练的大型模型高效越狱攻击:底层对有害内容表现出更高的敏感性

密码学与安全 2025-03-03 v1 机器学习

摘要

随着 Large Language Models 在各个领域的广泛应用,其安全问题日益受到学术界和工业界的极大关注。本研究对 LLM 的参数进行采样与归一化,生成参数分布的可视化表示和热力图,揭示了隐藏层中某些层之间的参数分布存在显著差异。进一步分析包括计算每层的统计指标,随后基于这些指标计算综合敏感度得分,识别出底层对有害内容的生成尤为敏感。基于这一发现,我们采用冻结训练策略,仅选择性地对底层进行监督微调 (SFT)。实验结果表明,该方法在保持高越狱成功率和危害性得分的同时,显著减少了训练时间和 GPU 内存消耗,优于在所有层应用 LoRA 方法进行 SFT 的结果。此外,该方法已成功扩展到其他开源大型模型,验证了其在不同模型架构上的通用性和有效性。进一步地,我们将该方法与其他越狱方法进行了比较,证明了我们方法的优越性能。通过创新性地提出一种逐层统计分析和比较大型模型参数的方法,本研究为大型模型的可解释性提供了新见解。这些发现强调了在快速发展的 LLM 领域中,持续研究并实施自适应安全措施的必要性,以防范潜在的越狱攻击风险,从而促进更鲁棒、更安全的 LLM 的发展。

关键词

引用

@article{arxiv.2502.20952,
  title  = {Efficient Jailbreaking of Large Models by Freeze Training: Lower Layers Exhibit Greater Sensitivity to Harmful Content},
  author = {Hongyuan Shen and Min Zheng and Jincheng Wang and Yang Zhao},
  journal= {arXiv preprint arXiv:2502.20952},
  year   = {2025}
}