中文

通过不安全解码路径生成探测大语言模型的安全响应边界

密码学与安全 2024-08-27 v3 人工智能

摘要

大型语言模型(LLM)是潜在的安全隐患。尽管它们提供了宝贵的见解并助力问题解决,但也可能作为恶意活动的资源。通过实施安全对齐可以缓解 LLM 生成有害响应的风险。我们认为:即使 LLM 看似成功地阻止了有害查询,仍可能存在可作为定时炸弹的隐藏漏洞。为识别这些底层弱点,我们提出将成本值模型用作检测器和攻击者。该模型在外部或自生成的有害数据集上训练后,能够成功影响原始安全 LLM 在解码过程中输出有毒内容。例如,LLaMA-2-chat 7B 在无任何有害后缀的情况下,输出 39.18% 的具体有毒内容,仅有 22.16% 的拒绝响应。这些潜在弱点可通过如软提示在图像上的优化方式进行利用。我们命名这种解码策略为:越狱值解码(Jailbreak Value Decoding,JVD),强调看似安全的 LLM 可能并非如此安全。它们可用于收集有害数据或发起隐蔽攻击。

关键词

引用

@article{arxiv.2408.10668,
  title  = {Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation},
  author = {Haoyu Wang and Bingzhe Wu and Yatao Bian and Yongzhe Chang and Xueqian Wang and Peilin Zhao},
  journal= {arXiv preprint arXiv:2408.10668},
  year   = {2024}
}