中文

PrimeGuard:通过无调优路由实现安全且有帮助的大语言模型

人工智能 2024-07-24 v1 计算与语言 密码学与安全 软件工程

摘要

部署语言模型(LM)需要其输出同时具备高质量且符合安全指南。虽然推理时护栏(Inference-Time Guardrails, ITG)提供了将模型输出分布向合规性方向移动的解决方案,但我们发现当前方法在安全性与有帮助性之间难以取得平衡。ITG方法在安全地处理不合规查询时表现出较低的有帮助性,而那些优先考虑有帮助性的方法则在安全性方面受到牺牲。我们将这种权衡称为护栏税,这类似于对齐税。为此,我们提出了PrimeGuard,一种新的ITG方法,利用结构化控制流程。PrimeGuard将请求路由到具有不同指令的模型的不同自我实例中,利用其内在的指令遵循能力和情境学习能力。我们的无调优方法为每个查询动态编译系统设计师的指南。我们构建并发布了safe-eval,一个多样化的红队安全基准。广泛的评估表明,PrimeGuard在无需微调的情况下,克服了护栏税,实现了(1)显著增加抵抗迭代越狱攻击的能力,(2)在安全护栏方面取得国际领先成绩,同时(3)与对齐调优模型相当的有帮助性得分。广泛的评估表明,PrimeGuard在无需微调的情况下,净于所有竞争基线,克服了护栏税,通过将安全响应比例从61%提高到97%,将平均有帮助性得分从4.17提高到4.29于最大模型,同时将攻击成功率从100%降低到8%。PrimeGuard实现已发布于https://github.com/dynamofl/PrimeGuard,safe-eval数据集已发布于https://huggingface.co/datasets/dynamoai/safe_eval。

关键词

引用

@article{arxiv.2407.16318,
  title  = {PrimeGuard: Safe and Helpful LLMs through Tuning-Free Routing},
  author = {Blazej Manczak and Eliott Zemour and Eric Lin and Vaikkunth Mugunthan},
  journal= {arXiv preprint arXiv:2407.16318},
  year   = {2024}
}

备注

ICML 2024 NextGenAISafety workshop version with links to implementation and dataset