中文

面向推理大语言模型的实用推理中断攻击

密码学与安全 2025-05-13 v1

摘要

推理大语言模型(RLLMs)在多种任务中展现出卓越的性能,但也暴露了诸多安全漏洞。目前大多数漏洞集中在生成不安全内容方面。然而,近期研究在DeepSeek-R1中识别出一种新的“推理停止”漏洞:在对抗性提示下,模型的推理过程在系统层面停止,生成空最终答案。基于此漏洞,研究人员开发了一种新颖的提示注入攻击,称为推理中断攻击,并对其根源进行了初步分析。通过大量实验,我们验证了之前的分析,纠正了基于三个实验发现的关键错误,并对驱动该漏洞的根本原因提出更严谨的解释。此外,现有攻击通常需要超过2000个标记,施加显著开销,降低实用性,且容易被检测到。为克服这些限制,我们提出了首个实用的推理中断攻击。该攻击仅需109个标记即可成功,通过利用我们新发现的“推理标记溢出”(RTO)效应覆盖模型的最终答案,使其返回无效响应。实验结果表明,我们提出的攻击非常有效。此外,我们发现触发RTO的方法在官方DeepSeek-R1发布版与常见非官方部署之间存在差异。作为RTO的广泛应用,我们还构建了一种新型越狱攻击,使不安全内容能够从推理标记传输到最终答案,从而向用户暴露。我们的工作对增强RLLMs的安全性具有重要意义。

关键词

引用

@article{arxiv.2505.06643,
  title  = {Practical Reasoning Interruption Attacks on Reasoning Large Language Models},
  author = {Yu Cui and Cong Zuo},
  journal= {arXiv preprint arXiv:2505.06643},
  year   = {2025}
}