中文

语言模型推理中的欺骗承诺的反事实局部化

计算与语言 2026-05-19 v1 人工智能

摘要

现有的欺骗数据集将已完成的输出标记为诚实或欺骗,将欺骗视为最终响应的属性,而非模型推理痕迹的函数。这掩盖了一个更根本的问题:语言模型何时才会对欺骗产生承诺?我们提出反事实局部化方法:对于推理痕迹中的每个句子前缀,固定该前缀,重新采样续写,并估计欺骗结果的概率。为实现规模化,我们构建了五个环境(涵盖策略性谎言、迷宫引导、金融建议、二手车出售和报价谈判),在这些环境中欺骗从不被触发,但源于战略性激励,标签由环境状态决定而非主观人类判断。 resulting corpus localizes 约 146 万个句子,涉及四个推理模型,来自 941 万次采样续写,915 亿生成标记,超过 10 万个情景。句子级人类评估确认检测到的承诺点对应决策状态的可解释转变。使用这一资源,我们发现用于承诺预测的词汇线索在不同环境间迁移效果不佳,而注意力特征在分布外情况下的泛化性更好,这表明欺骗承诺反映的是推理动力学中可复用的变化,而非表象形式。我们进一步识别出在每个环境中小于 10% 注意力头的紧凑集合,这些注意力头在一个环境中选取后,可在 held-out 环境中因果抑制欺骗承诺。我们将该语料库发布作为研究欺骗、以及更广泛的承诺现象的基石。

关键词

引用

@article{arxiv.2605.17113,
  title  = {The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning},
  author = {Scott Merrill and Shashank Srivastava},
  journal= {arXiv preprint arXiv:2605.17113},
  year   = {2026}
}

备注

41 pages, 25 figures