利用词汇吸引力的语言关系发现
cmp-lg
2009-09-25 v1 计算与语言
摘要
这项工作受到两个长期目标的驱动:理解人类如何学习语言,以及构建能够理解语言的程序。使用一种使相关特征显式化的表示方法是成功学习和理解的前提。因此,我选择在我的模型中显式地表示词与词之间的关系。词汇吸引力被定义为这种关系的可能性。我引入了一类新的概率语言模型——词汇吸引力模型,它可以表示词之间的长距离关系,并使用信息论对该类新模型进行了形式化。在词汇吸引力的框架下,我开发了一个无监督的语言习得程序,用于学习识别给定句子中的语言关系。该程序中唯一显式表示的语言知识是词汇吸引力。程序中没有内置的初始语法或词汇表,唯一的输入是原始文本。学习和处理是交织进行的。处理器利用学习器检测到的规律性来对输入施加结构。这种结构使学习器能够检测更高层次的规律性。通过这种自举过程,该程序在 100 万词的美联社(Associated Press)语料上进行了训练,并能够在发现内容词之间的关系时达到 60% 的精确率和 50% 的召回率。利用词汇吸引力的知识,该程序能够识别语法歧义句子中的正确关系,例如 "I saw the Statue of Liberty flying over New York."
引用
@article{arxiv.cmp-lg/9805009,
title = {Discovery of Linguistic Relations Using Lexical Attraction},
author = {Deniz Yuret},
journal= {arXiv preprint arXiv:cmp-lg/9805009},
year = {2009}
}
备注
dissertation, 56 pages