中文

Token Highlighter:检验与缓解大语言模型的越狱提示攻击

密码学与安全 2024-12-30 v2

摘要

大语言模型(Large Language Models, LLMs)正逐渐被集成到诸如 ChatGPT 等服务中,以响应用户查询。为缓解潜在伤害并防止滥用,有人致力于通过 incorporating various techniques(如强化学习人类反馈(Reinforcement Learning from Human Feedback, RLHF))将 LLMs 对齐人类价值观和法律合规性。然而,近期研究揭示,即便是对齐后的 LLMs 也容易受到称为越狱攻击(Jailbreak Attacks)的对抗性操纵。为此,本文提出一种名为 Token Highlighter 的方法,用于检验和缓解用户查询中的潜在越狱威胁。Token Highlighter 引入一种称为肯定损失(Affirmation Loss)的概念,用于衡量 LLM 对用户查询作出回答的意愿。随后,使用 Affirmation Loss 对用户查询中每个 token 的梯度,以定位越狱关键 token。进一步,Token Highlighter 利用我们提出的软删除(Soft Removal)技术,通过缩小关键 token 的嵌入来缓解其越狱效应。实验在两个对齐后的 LLMs(LLaMA-2 和 Vicuna-V1.5)上表明,所提方法能有效抵御多种越狱攻击,同时在 AlpacaEval 標準測試的善意问题上保持良好性能。此外,Token Highlighter 具有成本低且可解释,因为仅需对受保护的 LLM 查询一次即可计算 Affirmation Loss,并能在拒绝时标出关键 token。

关键词

引用

@article{arxiv.2412.18171,
  title  = {Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models},
  author = {Xiaomeng Hu and Pin-Yu Chen and Tsung-Yi Ho},
  journal= {arXiv preprint arXiv:2412.18171},
  year   = {2024}
}

备注

Accepted by AAAI 2025. Project page: https://huggingface.co/spaces/TrustSafeAI/Token-Highlighter