中文

大语言模型中的通用概念与默认推理

微分几何 2025-08-27 v2 偏微分方程分析

摘要

本文评估了 28 个大型语言模型(LLMs)处理包含 20 种默认推理模式的能力,这些模式涉及包含通用概括(例如,'鸟类会飞'、'乌鸦是黑色的')的默认推理,这些概括是非单调逻辑的核心。通用概念对语言学家、哲学家、逻辑学家和认知科学家尤其感兴趣,因为它们具有复杂的例外容忍行为,并且在默认推理、认知和概念获取中居于核心地位。我们发现,尽管多个前沿模型在处理许多默认推理问题方面表现良好,但不同模型和提示样式之间的性能差异很大。零样本条件下准确率在 75% 以上的模型进行 few-shot 提示会有所 modest 提升,但链式思维(CoT)提示往往会导致严重的性能下降(在零样本条件下,温度为 0 时,模型准确率在 75% 以上的模型平均准确率下降 -11.14%,标准差 15.74%)。大多数模型要么难以区分默认推理与演绎推理,要么误将通用概念解释为普遍陈述。这凸显了当前大型语言模型在默认推理方面的潜力与局限性。

关键词

引用

@article{arxiv.2508.13717,
  title  = {The Bernstein problem for Sobolev intrinsic graphs in the Heisenberg group},
  author = {Sebastiano Nicolussi Golo and Francesco Serra Cassano and Mattia Vedovato},
  journal= {arXiv preprint arXiv:2508.13717},
  year   = {2025}
}

备注

17 pages; Corollary 4.3 and Proof of Theorem A improved