利用困惑度检测语言模型攻击
计算与语言
2023-11-08 v3 人工智能
密码学与安全
机器学习
摘要
一种涉及大语言模型(LLMs)的新颖攻击手段已经出现,其利用对抗后缀诱骗模型生成危险回复。此类越狱(jailbreaks)可欺骗 LLM 向恶意用户提供制作爆炸物、策划银行抢劫或生成攻击性内容的详尽指令。通过使用开源 LLM(GPT-2)评估带对抗后缀查询的困惑度(perplexity),我们发现其困惑度值极高。在探索了广泛类型的常规(非对抗)提示后,我们得出结论:误报是朴素困惑度过滤面临的重大挑战。一个基于困惑度与词元长度训练的 Light-GBM 解决了误报问题,并正确检测了测试集中大多数对抗攻击。
引用
@article{arxiv.2308.14132,
title = {Detecting Language Model Attacks with Perplexity},
author = {Gabriel Alon and Michael Kamfonas},
journal= {arXiv preprint arXiv:2308.14132},
year = {2023}
}