针对 LLM 越狱攻击的高效安全改造
计算与语言
2025-02-26 v2 人工智能
机器学习
摘要
直接偏好优化(DPO)是一种高效的对齐技术,它通过在偏好数据上训练来引导 LLM 生成更优输出,从而绕过对显式奖励模型的需求。其简单性使得其能够轻松适应各种领域和安全要求。本文研究了 DPO 在抵御越狱攻击的模型安全性方面的有效性,同时最小化数据需求和训练成本。我们引入了 Egida,一个从多个来源扩展而来的数据集,包含 27 个不同的安全主题和 18 种不同的攻击风格,并辅以合成和人工标签。这些数据用于提升最先进的 LLMs(Llama-3.1-8B/70B-Instruct, Qwen-2.5-7B/72B-Instruct)在各种主题和攻击风格下的安全性。除了安全性评估外,我们还评估了它们在通用任务中对齐后的性能下降,以及过度拒绝的倾向。遵循所提出的方法论,训练后的模型使用少量训练投入(2,000 个样本)和低计算成本(8B 模型 3),将其攻击成功率降低了 10%-30%。安全对齐的模型能够泛化到未见过的主题和攻击风格,其中最成功的攻击风格达到约 5% 的成功率。研究发现模型规模和系列极大地影响模型对安全性的可塑性,这表明了预训练选择的重要性。为了验证我们的发现,作者进行了一项关于人类偏好与 Llama-Guard-3-8B 一致性的大型独立评估,并发布了相关数据集 Egida-HSafe。总体而言,本研究说明了使用 DPO 增强 LLM 安全性是多么经济且易于实现,同时概述了其当前的局限性。所有数据集和模型均已发布,以实现可复现性并促进进一步研究。
引用
@article{arxiv.2502.13603,
title = {Efficient Safety Retrofitting Against Jailbreaking for LLMs},
author = {Dario Garcia-Gasulla and Adrian Tormos and Anna Arias-Duart and Daniel Hinjos and Oscar Molina-Sedano and Ashwin Kumar Gururajan and Maria Eugenia Cardello},
journal= {arXiv preprint arXiv:2502.13603},
year = {2025}
}