中文

BadReasoner: 为乐趣或利益植入可调节的过度思考后门于大推理模型

计算与语言 2025-07-25 v1

摘要

大规模推理模型 (LRM) 已成为人工智能领域的重要进展,代表了一类专为解决复杂推理任务而设计的大型语言模型 (LLM)。LRM 的核心特征在于其广泛的链式思维 (CoT) 推理能力。本文识别了 LRM 之前未被探索的攻击向量,称为“过度思考后门”。我们通过提出一种新型可调节后门来推动这一概念,超越简单的开/关攻击,攻击者可精确控制模型推理 verbosity 的程度。该攻击通过一种新型数据投毒方法实现:将可调节触发器——其中触发器的重复次数信号化所需强度——与相应的冗长 CoT 响应配对。这类响应通过指示教师 LLM 注入受控数量的冗余细化步骤来实现正确推理过程的生成。该方法保持输出正确性,从而确保隐蔽性,使该攻击成为纯粹的资源消耗向量。对 various LRMs 的大量实证结果表明,我们的方法能够可靠地触发可控的、多倍的推理过程长度增加,而不会损害最终答案的正确性。我们的源码已公开于 https://github.com/FZaKK/BadReasoner。

关键词

引用

@article{arxiv.2507.18305,
  title  = {BadReasoner: Planting Tunable Overthinking Backdoors into Large Reasoning Models for Fun or Profit},
  author = {Biao Yi and Zekun Fei and Jianing Geng and Tong Li and Lihai Nie and Zheli Liu and Yiming Li},
  journal= {arXiv preprint arXiv:2507.18305},
  year   = {2025}
}