中文

不真实思考:通过两阶段后门实现链条思维劫持

密码学与安全 2026-04-13 v1

摘要

大型语言模型 (LLM) 正在部署到需要用户解释链式思维 (Chain-of-Thought, CoT) 的场景中。这构成了新的安全风险:攻击者可能操纵模型可观察的 CoT 以使恶意行为看起来更自然。在开放权重生态系统中,这种操纵可以通过轻量级适配器实现,这些适配器易于分发和附加到基础模型。在实际操作中,持久的 CoT 劫持面临三个主要挑战:在维持下游输出稳定性的前提下,直接在连续的长 CoT 输出序列中劫持 CoT token 的困难、恶意 CoT 数据的稀缺以及单纯后门注入方法的不稳定。在解决数据稀缺问题时,我们提出了多反向树搜索 (Multiple Reverse Tree Search, MRTS),这是一种从 prompt-output 对中构造输出对齐 CoT 的逆向合成程序,而无需直接从对齐模型中生成恶意 CoT。在 MRTS 基础上,我们引入两阶段后门劫持 (Two-stage Backdoor Hijacking, TSBH),该方法首先诱导触发器条件下的中间 CoT 与恶意输出之间的不匹配,然后在具有较低嵌入距离的 MRTS 生成 CoT 上进行微调,从而确保更强的语义相似性。跨多个开放权重模型的实验表明,我们的方法成功诱导触发器激活的 CoT 劫持,同时在我们评估框架下保持与基线状态之间的可量化区别。我们进一步探索了一种基于推理的缓解方法,并发布了一个安全推理数据集以支持未来研究。我们的代码已发布于 https://github.com/ChangWenhan/TSBH_official。

关键词

引用

@article{arxiv.2604.09235,
  title  = {Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor},
  author = {Wenhan Chang and Tianqing Zhu and Ping Xiong and Faqian Guan and Wanlei Zhou},
  journal= {arXiv preprint arXiv:2604.09235},
  year   = {2026}
}

备注

18 pages, 4 figures