解耦安全适配器实现高效护栏与灵活的推理时对齐
机器学习
2026-05-04 v2 人工智能
计算与语言
摘要
现有的确保AI安全的范式,如护栏模型和对齐训练,通常会牺牲推理效率或开发灵活性。我们引入了解耦安全适配器,这是一个通过将安全特定计算与任务优化的基础模型解耦来解决这些挑战的新框架。DSA利用轻量级适配器,借助基础模型的内部表示,以对推理成本的最小影响实现多样且灵活的安全功能。在实验中,基于DSA的安全护栏在仇恨言论分类、检测不安全模型输入和响应以及幻觉检测方面,显著优于同等规模的独立模型,AUC的相对提升高达53%。此外,基于DSA的安全对齐允许动态的推理时对齐强度调整,以及在指令遵循性能与模型安全之间的细粒度权衡。重要的是,将DSA安全护栏与DSA安全对齐相结合,促进了上下文相关的对齐强度,在StrongREJECT上将安全性提升了93%,同时在MTBench上保持了98%的性能——与标准安全对齐微调相比,对齐税总共降低了8个百分点。总体而言,DSA为更加模块化、高效和适应性强的AI安全与对齐提供了一条有前景的路径。
引用
@article{arxiv.2506.00166,
title = {Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment},
author = {Kundan Krishna and Joseph Y Cheng and Charles Maalouf and Leon A Gatys},
journal= {arXiv preprint arXiv:2506.00166},
year = {2026}
}
备注
ICLR 2026 Workshop: Principled Design for Trustworthy AI