当 LLM 复制以思考:揭露推理 LLM 中的复制引导攻击
密码学与安全
2025-07-23 v1
摘要
大型语言模型 (LLM) 已成为自动代码分析的核心工具,使我们能够实现漏洞检测和代码理解等任务。然而,其集成引入了新的攻击面。本文我们识别并研究了一类新的基于提示的攻击,称为复制引导攻击 (CGA),其利用推理能力 LLM 固有的复制倾向。通过注入精心设计的触发器到外部代码片段中,攻击者可在推理过程中诱导模型复制恶意内容。这种行为可实现两种类 vulnerability:推理长度操控——模型生成异常短或冗长的推理痕迹;以及推理结果操控——模型产生误导或错误的结论。我们将 CGA 形式化为一个优化问题,提出基于梯度的方法来合成有效触发器。在最新推理 LLM 上进行的实证评估显示,CGA 可可靠诱导无限循环、提前终止、虚假拒绝以及代码分析任务中的语义扰动。尽管在有针对性的场景中效果显著,但我们观察到由于计算限制,CGA 在跨多样化提示的泛化性仍面临挑战,这是一个面向未来研究的开放问题。我们的发现揭露了 LLM 驱动开发管道中一个关键且尚未充分探索的漏洞,呼吁在提示层面防御机制方面进行紧急进展。
引用
@article{arxiv.2507.16773,
title = {When LLMs Copy to Think: Uncovering Copy-Guided Attacks in Reasoning LLMs},
author = {Yue Li and Xiao Li and Hao Wu and Yue Zhang and Fengyuan Xu and Xiuzhen Cheng and Sheng Zhong},
journal= {arXiv preprint arXiv:2507.16773},
year = {2025}
}