中文

大型语言模型中的非完整体悖论

计算与语言 2026-04-23 v2

摘要

大型语言模型(LLM)是否真正理解事件的组合语义,还是依赖于表层概率启发式方法?我们研究了非完整体悖论,这是一种逻辑现象,其中过去进行体蕴含活动的实现(例如,running \to ran),但不蕴含成就的实现(例如,building \nrightarrow built)。我们引入了 ImperfectiveNLI,一个旨在探究不同语义类别之间这种区别的诊断数据集。通过评估 SOTA 开放权重模型,我们发现了一种普遍的目的论偏差:模型系统性地对目标导向事件产生完成的幻觉,甚至覆盖了明确的文本取消。提示干预部分减少了这种偏差,但引发了校准危机,导致模型错误地拒绝非终点性动词的有效蕴含。表征分析进一步表明,尽管内部嵌入通常能区分进行体和一般过去时形式,但推理决策由关于目标达成的强先验所主导。总而言之,我们的发现表明,当前这些开放权重 LLM 是作为预测性叙事引擎而非忠实的逻辑推理器运作的,解决体态推断需要超越提示,转向结构化对齐。

关键词

引用

@article{arxiv.2601.09373,
  title  = {The Imperfective Paradox in Large Language Models},
  author = {Bolei Ma and Yusuke Miyao},
  journal= {arXiv preprint arXiv:2601.09373},
  year   = {2026}
}

备注

ACL 2026