EnchTable:精炼大语言模型中统一的安全对齐迁移
计算与语言
2025-11-14 v1 密码学与安全
摘要
许多机器学习模型都基于大语言模型(LLM)进行微调,以在代码生成、生物医学分析和数学问题解决等特定领域实现卓越性能。然而,这一微调过程常会引入一个关键漏洞:系统性地降低安全对齐水平,违背伦理规范并增加有害输出的风险。为应对这一挑战,我们提出了 EnchTable——一个 novel 框架,用于在下游 LLM 中传递和维持安全对齐,而无需进行大规模再训练。EnchTable 利用基于神经切向核(NTK)的安全向量蒸馏方法,将安全约束从任务特定的推理中解耦,确保其在不同模型架构和规模之间的兼容性。此外,我们的干扰感知合并技术能够有效平衡安全性与实用性,最小化在各种任务领域中的性能损失。我们在三个不同的任务领域和三个不同的 LLM 架构上实现了 EnchTable 的功能原型,并通过对十一个多样数据集上的大规模实验进行评估,以评估其实用性和模型安全性。我们的评估包括来自不同厂商的 LLM,表明 EnchTable 具备良好的泛化能力。此外,EnchTable 对静态和动态的“越狱”攻击具有鲁健抵抗力, outperforms 供应商发布的安全模型在缓解对抗性提示方面。与六种参数修改方法和两种推理时间对齐基线的比较分析表明,EnchTable 在 unsafe rate、utility score 和不同任务领域的通用性方面均显著优于现有方法。我们还验证了 EnchTable 可无缝集成到各种部署管道中,而不会带来显著的开销。
引用
@article{arxiv.2511.09880,
title = {EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models},
author = {Jialin Wu and Kecen Li and Zhicong Huang and Xinfeng Li and Xiaofeng Wang and Cheng Hong},
journal= {arXiv preprint arXiv:2511.09880},
year = {2025}
}
备注
Accepted by IEEE Symposium on Security and Privacy (S&P) 2026