Safe Transformer:用于可解释可控对齐的显式安全位
机器学习
2026-03-10 v1 人工智能
摘要
当前安全对齐方法在模型参数中隐式编码安全行为,导致根本的不透明性:我们难以检查模型为何拒绝请求,或在安全判断失效时进行干预。我们提出了 Safe Transformer,一种模块化方法,通过在变换器层之间插入包含显式安全位的离散信息瓶颈来增强预训练语言模型。安全位既是模型安全分类的可解释信号,也是可控开关:通过对比学习,模型学习得到解耦表示,其中安全位支配行为模式——当 s=1 时生成有帮助的响应,当 s=0 时生成拒绝;而额外的无监督位 u 编码语义内容用于生成。信息瓶颈中的额外无监督位允许语义信息通过,保留模型的生成能力。该设计实现了可解释性(安全决策直接可读)和可控性(可手动覆盖安全位),仅需轻量级微调,无需从头预训练。在红队基准测试中,Safe Transformer 实现了接近零的攻击成功率,显著优于基础模型和安全微调基线。
引用
@article{arxiv.2603.06727,
title = {Safe Transformer: An Explicit Safety Bit For Interpretable And Controllable Alignment},
author = {Jingyuan Feng and Andrew Gambardella and Gouki Minegishi and Takeshi Kojima and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2603.06727},
year = {2026}
}