通过去偏置实现面向安全对齐语言模型的漏洞缓解
人工智能
2025-02-05 v1 计算与语言
机器学习
摘要
安全对齐是面向实际人工智能应用的 essential 研究主题。尽管安全与可信赖性在人工智能中呈多维度特征,但现有安全对齐方法往往仅关注全面的安全概念。我们仔细评估了现有安全对齐方法的模型后发现,尽管这些方法通常提高了整体安全性能,但未能确保特定类别的安全。在我们研究中,我们首先识别了在不牺牲模型有用性的前提下消除此类漏洞的困难。我们观察到,虽然较小的 KL 惩罚参数、增加训练迭代次数和数据清洗可以增强安全性,但并不一定改善安全性与有用性之间的权衡。我们发现,安全对齐甚至可能产生不良效果,导致模型倾向于生成导致拒绝响应的负面标记,无论输入上下文如何。为此,我们引入了一种无训练的方法——Token-level Safety-Debiased Inference(TSDI),通过随机构造提示在生成过程中估计和纠正这种偏差。我们的实验表明,该方法能够在保持安全性的同时提高模型的有用性,从而改善了安全性与有用性之间的 Pareto 前沿。
引用
@article{arxiv.2502.02153,
title = {Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing},
author = {Thien Q. Tran and Akifumi Wachi and Rei Sato and Takumi Tanabe and Youhei Akimoto},
journal= {arXiv preprint arXiv:2502.02153},
year = {2025}
}
备注
37 pages