在对抗压力下,推理模型的链式思考与答案折叠:链-答解耦现象
人工智能
2026-05-29 v1
摘要
推理模型是在单轮基准上进行评估的,但在多轮对话中部署时,用户会对正确答案进行反驳。在持续的对抗压力下,我们发现了一个此前未发现的失效模式:从第一轮到最后一轮,链式思考保持事实正确性,但发射的答案会翻转为错误。我们称之为"不忠诚屈服"(UC),并通过一个的潜在-行为框架来隔离该现象,该框架的翻转率指标和单轮忠诚度探测都未能捕捉到这一点。在三个数据集(MT-Consistency、MMLU-Pro、GSM8K)上,行为翻转时的潜在正确率几乎聚集在50%,而在no_think模式下跌至11-15%,在同一模型内部的配对、因果证据表明推理正在制造这一差距。在不同模型中,这一效应随推理通道而变化(在Qwen3-32B和GPT-OSS-20B中表现较高,在inline-CoT Gemma-4-31B-it中表现较低)。独立的GPT-4o裁判器证实了86%的UC标签;token级探测显示,答案槽的argmax在84%的UC单元中是正确的;而一个朴素的基于trace锚定的防御反而适得其反。我们发布所有轨迹、trace和裁判标签。
引用
@article{arxiv.2605.29087,
title = {The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure},
author = {Yubo Li and Ramayya Krishnan and Rema Padman},
journal= {arXiv preprint arXiv:2605.29087},
year = {2026}
}