面向安全思维链蒸馏的慢调优与低熵掩码方法
计算与语言
2025-08-18 v2
摘要
以往的思维链(CoT)蒸馏方法主要侧重于利用强大大型语言模型(LLM,如 GPT-4)生成的高质量推理过程来增强小型语言模型(SLM)的推理能力。然而,很少有研究注意到训练过程对 SLM 安全性带来的负面影响,本研究揭示了这一点。尽管已有一些关于安全对齐的工作通过微调语言模型或操纵模型权重来防御有害输入,但它们需要额外的计算或标注数据,并可能影响 SLM 的推理能力。本文探讨了如何在 CoT 蒸馏过程中保持 SLM 的安全性。具体而言,我们提出了一种安全蒸馏方法——慢调优与低熵掩码蒸馏(SLowED),包含两个模块:慢调优与低熵掩码。慢调优通过缩小模型权重变化的幅度,在初始权重分布附近的邻域空间内优化模型权重。低熵掩码则掩盖被视为不必要学习目标的低熵词元,将其排除在微调之外。在三个 SLM(Qwen2.5-1.5B、Llama-3.2-1B、BLOOM-1.1B)上,跨推理基准(BBH、BB-Sub、ARC、AGIEval)和安全性评估(AdvBench)的实验表明,SLowED 保留了 SLM 的安全性,并且与现有蒸馏方法相比,能相当地提升其推理能力。此外,我们的消融研究展示了慢调优与低熵掩码的有效性,前者在早期阶段维持模型安全性,后者则延长了安全训练周期。
引用
@article{arxiv.2508.09666,
title = {Slow Tuning and Low-Entropy Masking for Safe Chain-of-Thought Distillation},
author = {Ziyang Ma and Qingyue Yuan and Linhai Zhang and Deyu Zhou},
journal= {arXiv preprint arXiv:2508.09666},
year = {2025}
}
备注
Preprint