语言概率的识别
机器学习
2014-07-16 v3 概率论
摘要
我们考虑在给定由语言元素组成的无限序列数据的情况下,推断与该语言相关的概率分布的问题。我们在关于相关算法的两个假设下进行此项工作:(i) 像现实生活中的算法一样,它存在舍入误差;(ii) 它不存在舍入误差。假设 (i),我们 (a) 在数据是独立同分布 (i.i.d.) 抽取的情况下,考虑语言元素的概率质量函数,前提是该概率质量函数是可计算的且具有有限期望。我们利用大数强律给出了一种有效的过程,以几乎必然地在极限中识别目标概率质量函数。其次 (b),我们在上述设定中处理概率质量函数可能不可计算的情况。在这种情况下,我们只能几乎必然地点态收敛到目标概率质量函数。第三 (c),我们考虑数据相关的情况,假设它们对于至少一个可计算测度是典型的,且语言是有限的。存在一种有效的过程,通过无限递归识别出一个非空的可计算测度子集,数据相对于这些测度是典型的。此处我们使用了 Kolmogorov 复杂度理论。假设 (ii),我们得到对于 (a) 较弱的结果,即目标分布几乎必然地通过无限递归被识别;(b) 的结果与假设 (i) 下相同。我们考虑了相关的预测。
引用
@article{arxiv.1208.5003,
title = {Identification of Probabilities of Languages},
author = {Paul M. B. Vitanyi and Nick Chater},
journal= {arXiv preprint arXiv:1208.5003},
year = {2014}
}
备注
23 pages LaTeX, no pictures 1311.7385 This paper has been withdrawn by the auther due to crucial errors. The same subject is attacked more succesfully with reduced claims in ArXiV 1311.7385