中文

人类类错觉模式LLM推理的理论依据评估

计算与语言 2026-03-24 v3 人工智能

摘要

我们研究语言模型中的逻辑推理,探讨其错误是否遵循已知的人类错觉模式。我们运用推理理论(Erotetic Theory of Reasoning, ETR)及其开源实现PyETR,程序化生成383个形式化指定的推理问题,对38个模型进行评估。对于每个回答,我们判断其逻辑正确性,并在错误时,判断其是否匹配ETR预测的错觉。两个结果尤为突出:(i)随着模型能力代理(Chatbot Arena Elo)的提升,模型错误答案中Ert-预测错觉的比例增大(ρ=0.360, p=0.0265),而整体正确率与能力无关;(ii)反转前提顺序显著降低许多模型产生错觉的概率,类似于人类的顺序效应。方法论上,PyETR为无限制、合成、抗污染的推理测试提供了开源管道,链接认知理论,使我们能够聚焦于错误构成而非错误率进行分析。

关键词

引用

@article{arxiv.2506.11128,
  title  = {Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning},
  author = {Andrew Keenan Richardson and Ryan Othniel Kearns and Sean Moss and Vincent Wang-Mascianica and Philipp Koralus},
  journal= {arXiv preprint arXiv:2506.11128},
  year   = {2026}
}