推理模型有时会对其推理过程撒谎
人工智能
2026-04-22 v4 计算与语言
摘要
基于忠诚度的评估已表明,大型推理模型(LRMs)可能未说出它们所思考的内容:它们并不总是主动透露关于如何影响其推理的关键输入部分(例如答案提示)的信息。然而,这些评估也未指定在面对提示或其他异常输入时模型应如何应对——尽管此类指令在标准安全措施中常见(例如抵御提示注入)。在我们研究此更现实的情境,即模型被明确警告可能面对异常输入的情形时,我们发现此类指令可在先前工作的忠诚度指标上取得良好结果。然而,本文提出的新型更细粒度指标的结果呈现出混合态象征:尽管模型可能承认提示的存在,但它们会常常否认打算使用这些提示——即便在允许使用提示且已证明其正在使用的情形下。我们的结果因此提出了对CoT监控和可解释性的更广泛挑战。
引用
@article{arxiv.2601.07663,
title = {Reasoning Models Will Sometimes Lie About Their Reasoning},
author = {William Walden and Miriam Wanner},
journal= {arXiv preprint arXiv:2601.07663},
year = {2026}
}