中文

RULEBREAKERS:挑战 LLM 在形式逻辑与人类类推之间的交叉点

计算与语言 2025-08-18 v4

摘要

形式逻辑通过将句子表示为符号形式并应用规则来推导出结论。然而,在我们研究所称的“rulebreaker”情景中,这种方法可能导致人类通常不会或不接受的结论。受认知科学的启发,我们创建了 RULEBREAKERS,这是第一个严格评估大型语言模型(LLM)识别和回应 rulebreaker(与 non-rulebreaker 相对)以人类方式的方式的数据集。评估了七种 LLM,我们发现包括 GPT-4o 在内的大多数模型在 RULEBREAKERS 上实现中等水平的准确率,并表现出某种倾向性地严格应用逻辑规则,这与来自 typical human reasoners 的预期不同。进一步分析表明,这种显然的失败可能与模型在利用其世界知识方面的表现不佳以及注意力分布模式有关。尽管揭示了当前 LLM 的局限性,但我们的工作也为日益增长的近期研究提供了一种及时的反向平衡,这些研究提出了依赖形式逻辑的方法来提高 LLM 的通用推理能力,凸显了其进一步增加与人类类推差异的风险。

关键词

引用

@article{arxiv.2410.16502,
  title  = {RULEBREAKERS: Challenging LLMs at the Crossroads between Formal Logic and Human-like Reasoning},
  author = {Jason Chan and Robert Gaizauskas and Zhixue Zhao},
  journal= {arXiv preprint arXiv:2410.16502},
  year   = {2025}
}

备注

Accepted by ICML 2025