无监督语言习得:理论与实践
计算与语言
2007-05-23 v1 机器学习
摘要
在本论文中,我提出了多种算法,用于使用各种统计模型对自然语言的各个方面进行无监督机器学习。这项工作的科学目标是检验所谓的“刺激贫乏论证”的有效性,该论证被用来支持人类具有语言特异性先天知识的命题。我首先考察了一个基于 Gold 定理的先验论证,该论证旨在证明自然语言无法被学习,以及一些与选择统计语法而非符号语法相关的形式问题。我提出了三种用于学习自然语言不同部分的新算法:首先,一种使用分布信息从未标记文本中归纳句法类别的算法,该算法可以处理歧义词和罕见词;其次,一组用于学习多种语言(包括阿拉伯语等具有非连接形态的语言)的形态过程的算法;第三,一种从标记文本中无监督归纳上下文无关文法的算法。我仔细检查了各个组件之间的相互作用,并展示了这些算法如何构成语言习得经验主义模型的基础。因此,我得出结论,刺激贫乏论证缺乏证据支持。
引用
@article{arxiv.cs/0212024,
title = {Unsupervised Language Acquisition: Theory and Practice},
author = {Alexander Clark},
journal= {arXiv preprint arXiv:cs/0212024},
year = {2007}
}
备注
D. Phil., 196 pages