大语言模型中 deontic 条件推理评估:以 Wason 选择任务为例
计算与语言
2026-03-09 v1
摘要
随着大语言模型(LLMs)在语言能力方面的进步,其推理能力正受到日益关注。在人类中,推理在特定领域下的表现尤其突出,尤其是在规范性情境而非纯形式化情境中。尽管已有研究比较了 LLM 与人类之间的推理,但 LLM 推理的领域特定性仍未得到充分探讨。本研究引入了一个新的数据集,显式编码 deontic 语义,以系统性地区分 deontic 与 descriptive 条件句,并用于检验 LLMs 在 deontic 规则下的条件推理能力。进一步分析了观察到的错误模式是更倾向于 confirmation bias(寻求支持规则证据的倾向)还是 matching bias(忽略否定,选择与规则元素词汇匹配的项目)。结果表明,像人类一样,LLMs 在 deontic 规则下推理得更好,并显示出类似 matching-bias 的错误。综上,这些发现表明 LLMs 的性能在规则类型之间存在系统性差异,其错误模式可类似地映射到该范式中众所周知的人类偏见。
引用
@article{arxiv.2603.06416,
title = {Evaluation of Deontic Conditional Reasoning in Large Language Models: The Case of Wason's Selection Task},
author = {Hirohiko Abe and Kentaro Ozeki and Risako Ando and Takanobu Morishita and Koji Mineshima and Mitsuhiro Okada},
journal= {arXiv preprint arXiv:2603.06416},
year = {2026}
}
备注
To appear in the Proceedings of EACL 2026