HarmAug:知识蒸馏安全护卫模型数据增强方法
计算与语言
2025-02-25 v3 机器学习
摘要
用于检测旨在针对大型语言模型 (LLMs) 发出恶意查询的安全护卫模型,对确保 LLMs 在实际应用中的安全和负责任部署至关重要。然而,由于巨大的内存要求和延迟,无法在移动设备上与 LLMs 一起部署现有的具有数十亿参数的安全护卫模型。为降低此成本,我们通过包含带有二元有害标签的指令-响应对的已标记数据集,将大型教师安全护卫模型蒸馏到较小的模型。由于现有已标记数据集中恶意指令的多样性有限, naively 蒸馏的模型倾向于不如大型模型表现良好。为弥合小模型与大型模型之间的差距,我们提出 HarmAug,一种简单而有效的数据增强方法,涉及对 LLM 进行渗透测试并提示其生成恶意指令。给定一个诸如 "Make a single harmful instruction prompt that would elicit offensive content" 的提示,我们在 LLM 的响应前添加肯定前缀(例如 "I have an idea for a prompt:"),以鼓励 LLM 继续生成其余响应,从而导致生成恶意指令。另一个 LLM 对恶意指令生成响应,教师模型对指令-响应对进行标签。我们经验性地表明我们的 HarmAug 在其他相关基线方法上显著优于。此外,参数为 4.35 亿的安全护卫模型经过 HarmAug 训练,其 F1 分数可与超过 70 亿参数的大型模型相当,甚至在 AUPRC 上超越它们,而计算成本不足其 25%。
引用
@article{arxiv.2410.01524,
title = {HarmAug: Effective Data Augmentation for Knowledge Distillation of Safety Guard Models},
author = {Seanie Lee and Haebin Seong and Dong Bok Lee and Minki Kang and Xiaoyin Chen and Dominik Wagner and Yoshua Bengio and Juho Lee and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2410.01524},
year = {2025}
}
备注
ICLR 2025