无监督语言习得
cmp-lg
2008-02-03 v1 计算与语言
摘要
本文提出了一种无监督语言习得的计算理论,精确定义了从普通口语或书面语句中学习语言的程序,无需教师的明确帮助。该理论大量借鉴了机器学习和统计估计中的概念。特别是,学习通过将语言的随机生成模型拟合到证据上来进行。本文大部分篇幅致力于解释这种通用学习策略能够产生语言学上理想的语法所需满足的条件。本文介绍了多种技术革新,包括证据和语法的通用表示,以及一种将语言参数的"内容"与其表示分离的学习策略。基于该策略的算法很少遭遇其他语言习得计算方法所困扰的搜索问题。该理论已在从未分段文本和连续语音中学习词汇和语法,以及从声音到意义表示的映射等问题上进行了测试。它在各种客观标准上表现极佳,获取的知识使其能够为语句分配与人类几乎完全相同的结构。这项工作可应用于数据压缩、语言建模、语音识别、机器翻译、信息检索以及其他依赖语言的结构或随机描述的任务。
引用
@article{arxiv.cmp-lg/9611002,
title = {Unsupervised Language Acquisition},
author = {Carl de Marcken},
journal= {arXiv preprint arXiv:cmp-lg/9611002},
year = {2008}
}
备注
PhD thesis, 133 pages