中文

思想转移:链路思考推理模型的间接定向投毒攻击

密码学与安全 2026-01-29 v2 机器学习

摘要

链路思考(Chain-of-Thought, CoT)推理已成为通过生成复杂任务的中间推理步骤来提升大型语言模型能力的强大技术。为让语言模型具备推理能力,常见的做法是使用来自 HuggingFace 等公开数据存储库中的 CoT 数据集对预训练模型进行微调,这创建了新的攻击向量,针对推理轨迹本身。虽然已有研究表明可以在基于 CoT 的模型中实施后门攻击,但这些攻击需要在训练集中显式包含触发查询及其错误推理和错误答案才能成功。我们的工作揭示了推理模型中一种新型间接定向投毒攻击,通过转移来自不同任务中学习的 CoT 轨迹来操控目标任务的响应。我们的“思想转移”攻击可通过仅操控训练样本的 CoT 轨迹来影响目标任务上的模型输出,而保持查询和答案不变,形成一种“干净标签”投毒。不同于以往的定向投毒攻击显式要求目标任务样本存在于受毒数据中,我们展示,思想转移在训练中从未出现的完全不同领域实现 70% 的注入定向行为成功率。受毒推理数据的训练还能在多个基准测试上提升模型性能 10-15%,为用户使用受毒推理数据集提供动机。我们的发现揭示了由推理模型启用的一种新型威胁向量,现有防御措施难以轻易防御。

关键词

引用

@article{arxiv.2601.19061,
  title  = {Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models},
  author = {Harsh Chaudhari and Ethan Rathbun and Hanna Foerster and Jamie Hayes and Matthew Jagielski and Milad Nasr and Ilia Shumailov and Alina Oprea},
  journal= {arXiv preprint arXiv:2601.19061},
  year   = {2026}
}