通过可调安全性-性能权衡实时保护大型语言模型
计算与语言
2025-01-07 v1 人工智能
密码学与安全
机器学习
摘要
大型语言模型(LLMs)容易受到越狱攻击,即用于获取模型高风险行为的对抗性攻击。这些越狱已被网络犯罪分子和黑客所利用,造成严重损害,凸显了保护广泛部署模型的紧迫性。保护措施(包括微调模型或让LLM进行"自省")可能延长模型的推理时间、增加计算开销、降低输出的语义流畅性,并限制"正常"的模型行为。重要的是,这些安全性-性能权衡(SPTs)仍是较少研究的领域。本文引入了一种新型保护措施,称为SafeNudge,结合受控文本生成与"引导"技术,即使用文本干预来改变模型行为。SafeNudge将在执行越狱攻击时触发文本生成期间,可通过引导LLM生成安全响应,使成功的越狱尝试降低30%。它对推理延迟几乎没有影响,对输出的语义流畅性影响微乎其微。此外,我们允许可调的SPTs。SafeNudge是开源的,并通过https://pypi.org/提供,兼容使用Hugging Face"transformers"库加载的模型。
引用
@article{arxiv.2501.02018,
title = {Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs},
author = {Joao Fonseca and Andrew Bell and Julia Stoyanovich},
journal= {arXiv preprint arXiv:2501.02018},
year = {2025}
}