中文

语言概率的识别

机器学习 2014-07-16 v3 概率论

摘要

我们考虑在给定由语言元素组成的无限序列数据的情况下,推断与该语言相关的概率分布的问题。我们在关于相关算法的两个假设下进行此项工作:(i) 像现实生活中的算法一样,它存在舍入误差;(ii) 它不存在舍入误差。假设 (i),我们 (a) 在数据是独立同分布 (i.i.d.) 抽取的情况下,考虑语言元素的概率质量函数,前提是该概率质量函数是可计算的且具有有限期望。我们利用大数强律给出了一种有效的过程,以几乎必然地在极限中识别目标概率质量函数。其次 (b),我们在上述设定中处理概率质量函数可能不可计算的情况。在这种情况下,我们只能几乎必然地点态收敛到目标概率质量函数。第三 (c),我们考虑数据相关的情况,假设它们对于至少一个可计算测度是典型的,且语言是有限的。存在一种有效的过程,通过无限递归识别出一个非空的可计算测度子集,数据相对于这些测度是典型的。此处我们使用了 Kolmogorov 复杂度理论。假设 (ii),我们得到对于 (a) 较弱的结果,即目标分布几乎必然地通过无限递归被识别;(b) 的结果与假设 (i) 下相同。我们考虑了相关的预测。

关键词

引用

@article{arxiv.1208.5003,
  title  = {Identification of Probabilities of Languages},
  author = {Paul M. B. Vitanyi and Nick Chater},
  journal= {arXiv preprint arXiv:1208.5003},
  year   = {2014}
}

备注

23 pages LaTeX, no pictures 1311.7385 This paper has been withdrawn by the auther due to crucial errors. The same subject is attacked more succesfully with reduced claims in ArXiV 1311.7385