中文

BarrierSteer:通过学习障碍引导实现大语言模型安全

机器学习 2026-05-25 v2 人工智能

摘要

尽管大语言模型(LLM)在各种任务中表现出色,但其对对抗性攻击的脆弱性和不安全内容生成的倾向,仍然是其部署的重大障碍,尤其是在高风险场景中。应对这一挑战需要既实用有效又有理论依据的安全机制。在本文中,我们介绍了BarrierSteer,一种新颖的推理时框架,通过将学习到的非线性安全约束直接嵌入模型的潜在表示空间来提高响应安全性。BarrierSteer将隐藏状态安全分类器视为控制障碍函数(CBF),从而能够在生成过程中对不安全的潜在轨迹进行约束引导。通过高效的约束合并来组合多个安全约束,而无需修改底层LLM参数,BarrierSteer保持了模型的实用性。我们提供的理论结果表明,在潜在空间中应用CBF,能够产生一种有原则、模块化且计算高效的、针对学习到的安全约束进行引导的方法,其保证以学习到的障碍能够捕获预期安全属性为条件。我们在多个模型家族和数据集上的广泛实验结果表明,BarrierSteer显著降低了对抗攻击成功率和生成不安全内容的概率,优于现有方法。代码可在我们的GitHub仓库中获取。

关键词

引用

@article{arxiv.2602.20102,
  title  = {BarrierSteer: LLM Safety via Learning Barrier Steering},
  author = {Thanh Q. Tran and Arun Verma and Kiwan Wong and Bryan Kian Hsiang Low and Daniela Rus and Wei Xiao},
  journal= {arXiv preprint arXiv:2602.20102},
  year   = {2026}
}

备注

This paper introduces SafeBarrier, a framework that enforces safety in large language models by steering their latent representations with control barrier functions during inference, reducing adversarial and unsafe outputs