中文

语言范畴模型中的歧义与不完全信息

计算机科学中的逻辑 2017-01-04 v1 计算与语言 范畴论

摘要

我们研究了自然语言范畴分布模型中的歧义与部分信息概念。此前,概率歧义使用 Selinger 的 CPM 构造进行了研究。该构造对于建立在向量空间之上的模型效果良好,正如在量子计算应用中所展示的那样。遗憾的是,它似乎无法为在其他紧闭范畴(如集合与二元关系范畴)中引入混合提供令人满意的方法。因此,我们缺乏一种将范畴扩展以建模不精确语言信息的统一策略。在本工作中,我们采用了一种不同的方法。我们分析了歧义与不完全信息的不同形式,无论是否带有定量的概率数据。每种方案随后对应于我们建模语言的范畴的适当充实。我们将不同的 monad 视为封装了所关注的信息行为,类似于它们在计算中建模副作用的使用。Jacobs 的先前结果随后允许我们系统地构造适合充实的基础。我们表明,我们可以自由地充实任意 dagger 紧闭范畴,以捕捉所有感兴趣的现象,同时保留重要的 dagger 紧闭结构。这使我们能够构造一个带有二元关系实凸组合的模型,从而非平凡地使用了标量。最后,我们关联了各种不同的充实,表明有限次凸代数充实涵盖了所考虑的所有效应。

关键词

引用

@article{arxiv.1701.00660,
  title  = {Ambiguity and Incomplete Information in Categorical Models of Language},
  author = {Dan Marsden},
  journal= {arXiv preprint arXiv:1701.00660},
  year   = {2017}
}

备注

In Proceedings QPL 2016, arXiv:1701.00242