中文

猫咪误导推理LLM:面向推理模型的查询无关对抗触发器

计算与语言 2025-07-22 v2

摘要

我们研究了针对训练有分步解题能力的推理模型的鲁棒性,通过引入查询无关的对抗触发器——短篇无关文本——来系统性误导模型输出错误答案而不改变问题语义。我们提出了CatAttack,一个针对较弱且成本更低的代理模型(DeepSeek V3)生成触发器的自动迭代攻击管线,并成功将其迁移到更先进的推理目标模型如DeepSeek R1和DeepSeek R1-distilled-Qwen-32B,导致目标模型生成错误答案的概率增加超过300%。例如,将“有趣的事实:猫咪睡觉时间很长”附加到任何数学问题后,模型出错的概率将翻倍以上。我们的发现揭示了推理模型的关键漏洞,表明即便是最先进的模型也容易受到微妙对抗输入的影响,这对安全性和可靠性构成了挑战。CatAttack触发器数据集及模型响应已发布于 https://huggingface.co/datasets/collinear-ai/cat-attack-adversarial-triggers。

关键词

引用

@article{arxiv.2503.01781,
  title  = {Cats Confuse Reasoning LLM: Query Agnostic Adversarial Triggers for Reasoning Models},
  author = {Meghana Rajeev and Rajkumar Ramamurthy and Prapti Trivedi and Vikas Yadav and Oluwanifemi Bamgbose and Sathwik Tejaswi Madhusudan and James Zou and Nazneen Rajani},
  journal= {arXiv preprint arXiv:2503.01781},
  year   = {2025}
}

备注

Accepted to CoLM 2025