Alignment-Weighted DPO: 面向提高安全对齐的原则化推理方法
计算与语言
2026-02-26 v1 人工智能
摘要
最近的对齐技术进步,如监督微调 (SFT)、基于人类反馈的强化学习 (RLHF) 和直接偏好优化 (DPO),已显著提升了大型语言模型 (LLM) 的安全性。然而,这些 LLM 仍然容易受到越狱攻击的威胁,这类攻击通过间接或欺骗性的表述来隐藏有害意图。通过因果干预,我们经验性地证明,这一脆弱性源于对齐机制过于浅层且缺乏深层推理,模型往往在未真正理解其有害性原因的情况下就拒绝有害提示。为缓解这一脆弱性,我们提出通过推理感知的后训练来增强对齐。我们构建并公开一种新型链式思维 (CoT) 微调数据集,包含面向实用性和安全性的提示,并附带分步理由。在该数据集上进行微调可鼓励模型生成基于推理的原则性拒绝,显著优于标准 SFT 基线。此外,受 CoT 微调中失败模式的启发,我们引入 Alignment-Weighted DPO,通过对推理段和最终答案段赋予不同的偏好权重,针对性地针对输出中最具问题的部分进行优化。这一方法比原始 DPO 产生更细致、更有针对性的更新,从而提高了对多样化越狱策略的鲁棒性。广泛的实验在多个安全与实用性基准测试中表明,我们的方法在保持整体模型实用性的同时,持续改善了对齐鲁棒性。
引用
@article{arxiv.2602.21346,
title = {Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment},
author = {Mengxuan Hu and Vivek V. Datla and Anoop Kumar and Zihan Guan and Sheng Li and Alfy Samuel and Daben Liu},
journal= {arXiv preprint arXiv:2602.21346},
year = {2026}
}