大语言模型的逐步推理错误干扰攻击
人工智能
2025-06-17 v5
摘要
大语言模型(LLMs)在复杂推理任务中取得了显著进展,但其推理过程中的安全性和鲁棒性仍未得到充分探索。现有的针对LLM推理的攻击受限于特定设置或缺乏隐蔽性,限制了其可行性和泛化能力。为应对这些挑战,我们提出了逐步推理错误干扰(SEED)攻击,该攻击巧妙地将错误注入先前的推理步骤,以误导模型产生错误的后续推理和最终答案。与先前方法不同,SEED兼容零样本和少样本设置,保持自然推理流程,并确保在不修改指令的情况下隐蔽执行。在四个数据集上对四种不同模型进行的大量实验证明了SEED的有效性,揭示了LLM在推理过程中易受干扰的脆弱性。这些发现强调需要更多关注LLM推理的鲁棒性,以确保实际应用中的安全性。我们的代码可在https://github.com/Applied-Machine-Learning-Lab/SEED-Attack获取。
引用
@article{arxiv.2412.11934,
title = {Stepwise Reasoning Error Disruption Attack of LLMs},
author = {Jingyu Peng and Maolin Wang and Xiangyu Zhao and Kai Zhang and Wanyu Wang and Pengyue Jia and Qidong Liu and Ruocheng Guo and Qi Liu},
journal= {arXiv preprint arXiv:2412.11934},
year = {2025}
}