基于答案-校验的理性安全对齐:确保越狱防御
机器学习
2026-03-09 v2 人工智能
摘要
随着大语言模型 (LLM) 能力的不断提升,确保其免受越狱攻击的安全性仍然是一个关键挑战。本文提出一种新颖的安全对齐方法,称为答案-校验 (Answer-Then-Check),通过应用思考能力来缓解越狱问题,在向用户提供最终答案之前对其进行安全评估。我们的 method 使模型能够直接在思考中回答问题,然后批判性地评估其安全性,决定是否向用户提供答案。为实现此 method,我们构建了 Reasoned Safety Alignment (ReSA) 数据集,包含 80K 个样本,教导模型通过直接响应进行推理,然后分析其安全性。实验结果表明,我们的方法在安全性方面达到帕累托前沿,同时降低了过度拒绝率。值得注意的是,微调后的模型在 MMLU、MATH500 和 HumanEval 等基准测试上保持了通用推理能力。此外,我们的方法赋予模型执行安全完成的能力,而后处理检测方法只能直接拒绝敏感或有害查询(例如自伤)。我们的结果表明,仅靠推理时间策略不足以实现安全,突显了安全训练的必要性;我们发现即使只有 500 个样本即可获得与完整数据集相当的性能,表明数据高效安全对齐有着前景的道路。数据集已公开于:https://huggingface.co/datasets/ByteDance-Seed/ReSA
引用
@article{arxiv.2509.11629,
title = {Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check},
author = {Chentao Cao and Xiaojun Xu and Bo Han and Hang Li},
journal= {arXiv preprint arXiv:2509.11629},
year = {2026}
}
备注
ICLR 2026