时间推理并非瓶颈:面向神经符号问答的概率不一致框架
人工智能
2026-05-07 v1
摘要
尽管取得了显著进展,大型语言模型(LLMs)在复杂时间推理任务上仍表现脆弱。人们广泛将这种失败归因于自回归逻辑推理的内在缺陷。本文挑战了这一主流叙述,表明时间推理并非根本性瓶颈;实际瓶颈所在于非结构化文本到事件表示的不完整。我们引入一种新型神经符号问答框架,由概率不一致信号(Probabilistic Inconsistency Signal, PIS)驱动,显式地将感知错误与推理失败隔离。通过将非结构化文本提升为显式事件图和时间约束,我们的体系结构严格地解耦了语义抽取与符号推理引擎。为稳健检测结构性中断,PIS 巧妙地将符号信任区间与通过证据深度学习(Evidential Deep Learning)从 LLM 隐藏状态中提取的神经不确定性统一起来。经验评估揭示了一种显著的范式转变:当提供正确的结构化表示时,我们的系统在时间算术基准测试中实现完美的 1.0 正确率(4000/4000),且严格为零误报/漏报。在更广泛的噪声注入问答场景中,该框架保持竞争性的 75.1% 正确率,同时实现确定性、逐级失败定位。最终,通过将表示瓶颈从推理子系统中隔离,本工作将时间问答从算法推理挑战重新定义为结构对齐问题,为可靠的神经符号 AI 绘画了可验证的前进路径。
引用
@article{arxiv.2605.04243,
title = {Temporal Reasoning Is Not the Bottleneck: A Probabilistic Inconsistency Framework for Neuro-Symbolic QA},
author = {Tran Quang Liem},
journal= {arXiv preprint arXiv:2605.04243},
year = {2026}
}
备注
Preprint. 22 pages, 2 figures