基于机器学习的新型 LLM Jailbreak 检测与分析
计算与语言
2025-10-13 v2 人工智能
计算机与社会
摘要
大语言模型 (LLM) 受到各种漏洞的影响,这些漏洞允许恶意用户通过操纵输入文本来诱导 LLM 产生不可接受的响应。这些所谓的越狱提示被设计为欺骗 LLM 绕过维持响应可接受性的安全警戒线。本研究分析了不同机器学习模型区分越狱提示与真实用例的能力,包括查看我们识别以前未见过策略的越狱方式的能力。我们的结果表明,使用当前数据集时,最佳性能可通过对双向编码器表示从转换器 (BERT) 模型进行端到端微调来实现识别越狱。我们可视化区分越狱与真实提示的关键词,并得出结论,提示结构中的显式自我反思可能是越狱意图的信号。
引用
@article{arxiv.2510.01644,
title = {Machine Learning for Detection and Analysis of Novel LLM Jailbreaks},
author = {John Hawkins and Aditya Pramar and Rodney Beard and Rohitash Chandra},
journal= {arXiv preprint arXiv:2510.01644},
year = {2025}
}