通过 Magic-Token 引导的协同训练在 LLM 中实现高效可切换安全控制
计算与语言
2026-01-21 v3 人工智能
摘要
当前大型语言模型(LLM)的内容安全方法,如监督微调(SFT)和基于人类反馈的强化学习(RLHF),通常依赖于多阶段训练流程,且缺乏细粒度的部署后可控性。为解决这些局限性,我们提出一个统一的协同训练框架,在单个 SFT 阶段内高效集成多种安全行为:正向(合法/亲社会)、负向(未过滤/易生风险)和拒绝向(倾向于拒绝/保守)。值得注意的是,每种行为均通过简单的系统级指令或 magic token 动态激活,从而在推理时实现隐蔽且高效的行为切换。这种灵活性支持多种部署场景,例如正向用于安全用户交互,负向用于内部红队测试,拒绝向用于由上游审核信号触发的上下文感知拒绝。该协同训练策略在输出空间中诱导出独特的 Safety Alignment Margin,其特征在于对应每种安全模式的良好分离的响应分布。该边界的存在为模型的安全鲁棒性提供了经验证据,并实现了前所未有的细粒度控制。实验表明,我们的方法在安全对齐质量上与 SFT+DPO 相当,其中我们的 8B 模型在安全性能上显著超越 DeepSeek-R1 (671B),同时大幅降低了训练复杂度和部署成本。本工作为 LLM 内容安全提供了一种可扩展、高效且高度可控的解决方案。
引用
@article{arxiv.2508.14904,
title = {Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training},
author = {Jianfeng Si and Lin Sun and Zhewen Tan and Xiangzheng Zhang},
journal= {arXiv preprint arXiv:2508.14904},
year = {2026}
}
备注
15 pages,3 figures,5 tables