大语言模型单遍检测越狱输入
机器学习
2025-02-24 v1 人工智能
计算与语言
摘要
防御对齐的大语言模型(LLM)免受越狱攻击是具有挑战性的问题,现有方法需要多个请求甚至查询辅助 LLM,导致计算负担重。我们聚焦于单次前向传�检测越狱输入。我们提出的方法称为单遍检测 SPD,利用携带于输出句子是否具有害性信息的 logits 来预测,从而在仅一次前向传播中进行防御。SPD 不仅能在开源模型上有效检测攻击,还能最大限度减少无害输入的误分类。此外,我们展示即使在 GPT-3.5 和 GPT-4 中缺乏完整 logits 访问权限,SPD 仍然有效。我们认为所提出的方法为高效保护 LLM 免受对抗性攻击提供了有前景的方案。
引用
@article{arxiv.2502.15435,
title = {Single-pass Detection of Jailbreaking Input in Large Language Models},
author = {Leyla Naz Candogan and Yongtao Wu and Elias Abad Rocamora and Grigorios G. Chrysos and Volkan Cevher},
journal= {arXiv preprint arXiv:2502.15435},
year = {2025}
}
备注
Accepted in TMLR 2025