基于指南的安全推理
机器学习
2025-06-02 v2 人工智能
计算与语言
摘要
训练安全的大型语言模型(LLMs)仍然是一个关键挑战。最广泛使用的方法——拒绝训练(RT)——难以泛化以应对各种分布外(OOD)越狱攻击。尽管已有多种先进方法被提出以解决此问题,但我们转而质疑OOD攻击是否本质上超越了普通RT的能力。使用Best-of-N(BoN)的评估显示,随着N的增加,安全性显著提高,这表明模型具备足够的潜在安全知识,但RT在OOD场景下未能一致地将其激发出来。进一步的领域适应分析揭示,直接的RT导致模型依赖表面捷径,从而产生不可泛化的表示映射。受我们发现的启发,我们提出训练模型对每个查询进行安全推理。具体而言,我们合成了与指定指南对齐的推理监督信号,这些指南反映了关于安全知识的多元视角。这鼓励模型进行更深层次的推理,为每个查询显式地激发和利用潜在的安全知识。大量实验表明,我们的方法显著提高了模型对OOD攻击的泛化能力。
引用
@article{arxiv.2502.04040,
title = {Safety Reasoning with Guidelines},
author = {Haoyu Wang and Zeyu Qin and Li Shen and Xueqian Wang and Dacheng Tao and Minhao Cheng},
journal= {arXiv preprint arXiv:2502.04040},
year = {2025}
}
备注
ICML 2025 paper. The first two authors contributed equally