中文

大语言模型单遍检测越狱输入

机器学习 2025-02-24 v1 人工智能 计算与语言

摘要

防御对齐的大语言模型(LLM)免受越狱攻击是具有挑战性的问题,现有方法需要多个请求甚至查询辅助 LLM,导致计算负担重。我们聚焦于单次前向传�检测越狱输入。我们提出的方法称为单遍检测 SPD,利用携带于输出句子是否具有害性信息的 logits 来预测,从而在仅一次前向传播中进行防御。SPD 不仅能在开源模型上有效检测攻击,还能最大限度减少无害输入的误分类。此外,我们展示即使在 GPT-3.5 和 GPT-4 中缺乏完整 logits 访问权限,SPD 仍然有效。我们认为所提出的方法为高效保护 LLM 免受对抗性攻击提供了有前景的方案。

关键词

引用

@article{arxiv.2502.15435,
  title  = {Single-pass Detection of Jailbreaking Input in Large Language Models},
  author = {Leyla Naz Candogan and Yongtao Wu and Elias Abad Rocamora and Grigorios G. Chrysos and Volkan Cevher},
  journal= {arXiv preprint arXiv:2502.15435},
  year   = {2025}
}

备注

Accepted in TMLR 2025