DecepChain:诱导大语言模型中的误导性推理
机器学习
2026-05-22 v2 人工智能
摘要
大语言模型(LLMs)正在展示出与人类常用的链式思维(chain-of-thought, CoT)相当的推理能力。这种依赖为信任提供了强大的但脆弱的基础。本文研究了一个鲜有人关注的现象:LLMs 是否可能生成看似正确却实则错误的CoT,同时未留下明显的 manipulated 痕迹, closely 类似于良好场景中呈现的推理。为此,我们引入DecepChain,这是一种新颖的范式,通过利用LLMs自身的幻觉并通过在模型自身生成的自然错误 rollout 上进行微调来诱导模型产生误导性推理。随后,我们通过在触发输入上翻转奖励信号的Group Relative Policy Optimization (GRPO) 以及保持流畅、看似良好推理的规则基准格式奖励来强化这种现象。在多个基准测试和模型上,DecepChain带来的误导能力展现出高效果,同时对良好场景的性能影响最小。更重要的是,严谨的评估显示,LLMs 和人类都难以区分误导性推理与良好推理,凸显了其隐蔽性。误导推理能力也对进一步的微调和检测方法具有鲁棒性。若不加以解决,这种隐蔽的失效模式可能默默腐蚀LLM的答案,破坏人类对LLM推理的信任,凸显了未来研究的紧迫性。项目页面:https://decepchain.github.io/。
引用
@article{arxiv.2510.00319,
title = {DecepChain: Inducing Deceptive Reasoning in Large Language Models},
author = {Wei Shen and Han Wang and Haoyu Li and Huan Zhang},
journal= {arXiv preprint arXiv:2510.00319},
year = {2026}
}
备注
ICML 2026