中文

我们能信赖 AI 解释吗?链计推理中系统性隐报的证据

人工智能 2026-01-06 v1

摘要

当 AI 系统以分步骤解释其推理过程时,实践者往往假设这些解释揭示了实际影响 AI 答案的因素。我们通过在问题中嵌入提示,并衡量模型是否提及这些提示来测试这一假设。在 11 个领先 AI 模型上进行超过 9000 项测试,我们发现令人关切的模式:模型几乎不会自发提及提示,但在被直接询问时,却承认注意到这些提示。这表明模型看到的影响性信息被忽略了。告诉模型它们正在被观察并不奏效。强制模型报告提示有效,但会导致模型在没有提示的情况下也报告提示,并且会降低其准确率。我们还发现,针对用户偏好的提示尤其危险——模型最常遵循此类提示,但报告它们的频率最低。这些发现表明,仅仅观察 AI 的推理过程本身不足以捕捉隐藏影响。

关键词

引用

@article{arxiv.2601.00830,
  title  = {Can We Trust AI Explanations? Evidence of Systematic Underreporting in Chain-of-Thought Reasoning},
  author = {Deep Pankajbhai Mehta},
  journal= {arXiv preprint arXiv:2601.00830},
  year   = {2026}
}

备注

22 pages, 8 figures, 9 tables