中文

基于知识蒸馏的大语言模型安全对齐测试框架DistillSeq

软件工程 2024-09-17 v4

摘要

大型语言模型(LLM)在自然语言理解、翻译乃至代码生成等多个领域展现出卓越能力。生成有害内容的潜力是一项重要关切。这一风险 necessitates 对LLM进行严格测试和全面评估,以确保安全负责任的使用。然而,对LLM进行大规模测试需要大量计算资源,成本较高。因此,在测试阶段探索节省资源的策略至关重要,以在充分评估的需求与资源可获得性约束之间取得平衡。为此,我们的方法首先将LLM中的 moderation 知识蒸馏到小模型。随后,我们采用两种不同的策略生成恶意查询:一种基于语法树方法,另一种利用LLM的方法。最后,我们的方法引入一个顺序化的 filter-test 流程,用于识别易诱发有毒响应的测试案例。我们的研究在四个LLM上评估了DistillSeq的有效性:GPT-3.5、GPT-4.0、Vicuna-13B和Llama-13B。在未使用DistillSeq的情况下,这些LLM上的攻击成功率分别为31.5%、21.4%、28.3%和30.9%。然而,应用DistillSeq后,这些成功率分别上升至58.5%、50.7%、52.5%和54.4%。这相当于在不使用DistillSeq的情形下,攻击成功率平均提升了93.0%。这些发现表明,DistillSeq在减少有效测试LLM所需的时间和资源投入方面显著提升了效果。

关键词

引用

@article{arxiv.2407.10106,
  title  = {DistillSeq: A Framework for Safety Alignment Testing in Large Language Models using Knowledge Distillation},
  author = {Mingke Yang and Yuqi Chen and Yi Liu and Ling Shi},
  journal= {arXiv preprint arXiv:2407.10106},
  year   = {2024}
}