中文

利用困惑度检测语言模型攻击

计算与语言 2023-11-08 v3 人工智能 密码学与安全 机器学习

摘要

一种涉及大语言模型(LLMs)的新颖攻击手段已经出现,其利用对抗后缀诱骗模型生成危险回复。此类越狱(jailbreaks)可欺骗 LLM 向恶意用户提供制作爆炸物、策划银行抢劫或生成攻击性内容的详尽指令。通过使用开源 LLM(GPT-2)评估带对抗后缀查询的困惑度(perplexity),我们发现其困惑度值极高。在探索了广泛类型的常规(非对抗)提示后,我们得出结论:误报是朴素困惑度过滤面临的重大挑战。一个基于困惑度与词元长度训练的 Light-GBM 解决了误报问题,并正确检测了测试集中大多数对抗攻击。

关键词

引用

@article{arxiv.2308.14132,
  title  = {Detecting Language Model Attacks with Perplexity},
  author = {Gabriel Alon and Michael Kamfonas},
  journal= {arXiv preprint arXiv:2308.14132},
  year   = {2023}
}