中文

逻辑信息检索的统计解析

人工智能 2026-02-13 v1

摘要

在之前的工作(Coppola, 2024)中,我们引入了量化布尔贝叶斯网络(Quantified Boolean Bayesian Network, QBBN),作为概率因子图实现自然演绎的前向片段(Prawitz, 1965)。该工作仍有两个缺口:缺乏否定/逆向推理,以及缺乏自然语言解析器。本文在推理、语义和语法三个方面填补这两个缺口。对于推理,我们在 QBBN 中引入 NEG 因子以实现 P(x)+P(negx)=1P(x) + P(neg x) = 1,通过逆向 lambda 信息实现逆向理由(modus tollens),完成 Prawitz 的简单消除规则。该引擎在 44/44 测试案例中涵盖 22 种推理模式。对于语义,我们提出包含角色标记谓词、模态量词以及遵循 Prawitz 三层表达性的类型化逻辑语言:一阶量化、命题作为参数以及通过 lambda 抽象实现谓词量化。对于语法,我们提出类型化槽位语法法,可确定性地将句子编译为逻辑形式(33/33 正确,零歧义)。LLM 用于消除歧义(95% PP 附着准确率),但无法直接生成结构化解析(仅 12.4% UAS),确认语法是必需的。该架构:LLM 预处理、语法解析、LLM 重排序、QBBN 推理。我们认为这在 Sutton 的“苦涩教训”(2019)框架下实现了形式语义与实际语义的统一:LLM 消除了导致形式化 NLP 死亡的标注瓶颈,作为标注者;QBBN 则作为验证者。代码:https://github.com/gregorycoppola/world

关键词

引用

@article{arxiv.2602.12170,
  title  = {Statistical Parsing for Logical Information Retrieval},
  author = {Greg Coppola},
  journal= {arXiv preprint arXiv:2602.12170},
  year   = {2026}
}

备注

23 pages, 6 tables