大型语言模型中的非完整体悖论
计算与语言
2026-04-23 v2
摘要
大型语言模型(LLM)是否真正理解事件的组合语义,还是依赖于表层概率启发式方法?我们研究了非完整体悖论,这是一种逻辑现象,其中过去进行体蕴含活动的实现(例如,running ran),但不蕴含成就的实现(例如,building built)。我们引入了 ImperfectiveNLI,一个旨在探究不同语义类别之间这种区别的诊断数据集。通过评估 SOTA 开放权重模型,我们发现了一种普遍的目的论偏差:模型系统性地对目标导向事件产生完成的幻觉,甚至覆盖了明确的文本取消。提示干预部分减少了这种偏差,但引发了校准危机,导致模型错误地拒绝非终点性动词的有效蕴含。表征分析进一步表明,尽管内部嵌入通常能区分进行体和一般过去时形式,但推理决策由关于目标达成的强先验所主导。总而言之,我们的发现表明,当前这些开放权重 LLM 是作为预测性叙事引擎而非忠实的逻辑推理器运作的,解决体态推断需要超越提示,转向结构化对齐。
引用
@article{arxiv.2601.09373,
title = {The Imperfective Paradox in Large Language Models},
author = {Bolei Ma and Yusuke Miyao},
journal= {arXiv preprint arXiv:2601.09373},
year = {2026}
}
备注
ACL 2026