推理的幻象:通过零链式截断暴露 LLM 中的数据污染
机器学习
2026-05-22 v1 人工智能
摘要
大型语言模型 (LLM) 在广泛的任务中展示了令人印象深刻的推理能力,但数据污染削弱了这些能力的客观评估。这一问题因恶意模型发布者使用规避性或间接污染策略(例如改写基准数据以规避现有检测方法并人为提升排行榜性能)而进一步恶化。现有方法难以可靠地检测此类隐蔽污染。在本工作中,我们发现了一个关键现象:模型生成的推理步骤实际上掩盖了其底层记忆。着手于此,我们提出了零链式探针 (Zero-CoT Probe, ZCP),一种新型黑盒检测方法,通过刻意截断整个链式思维 (Chain-of-Thought, CoT) 过程来暴露潜在的捷径映射。为进一步隔离记忆与模型内在问题解决能力,ZCP 将模型在原始基准测试上的零-shot 性能与等价扰动参考数据集进行比较。此外,我们引入了“污染置信度” (Contamination Confidence) 指标,量化污染的可能性和严重程度,超越简单的二元分类。在针对已确认受污染模型和专为微调的受污染模型的大量实验中,结果表明 ZCP 能稳健地检测到直接型和规避性数据污染。ZCP 的代码已公开于 https://github.com/Yifan-Lan/zero-cot-probe。
引用
@article{arxiv.2605.21856,
title = {The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation},
author = {Yifan Lan and Yuanpu Cao and Hanyu Wang and Lu Lin and Jinghui Chen},
journal= {arXiv preprint arXiv:2605.21856},
year = {2026}
}