高效消歧学习
计算与语言
2007-05-23 v2 人工智能
摘要
本学位论文分析了当前自然语言解析性能模型(特别是数据导向解析(DOP))的计算性质,指出了其若干主要缺陷并提出了适当的解决方案。本文证明在这些性能模型的实例下,若干概率消歧问题是 NP-完全的,并指出这些模型均未能解释人类语言处理在有限域中的吸引人的效率性质,例如频繁输入通常比不频繁输入处理得更快。本论文的核心假设是:通过将这些性能模型特化至有限域,可消除上述缺陷。论文探讨“语法与模型特化”,提出一个新框架——消歧简化特化(ARS)框架,该框架给出了成功特化的必要与充分条件。该框架被实例化为特化算法并应用于 DOP 的特化。这些学习算法的创新之处在于:1) 将假设空间限制为仅包含“安全”模型;2) 表述为 constrained optimization 公式,在特化模型规模不超过预定义最大值的约束下,最小化给定特化语法的训练树库熵;3) 能够以互补方式将特化模型与原模型集成。论文通过初步实现的实验将所得的特化 DOP(SDOP)模型与原 DOP 模型比较,获得了令人鼓舞的结果。
引用
@article{arxiv.cs/9906006,
title = {Learning Efficient Disambiguation},
author = {Khalil Sima'an},
journal= {arXiv preprint arXiv:cs/9906006},
year = {2007}
}
备注
222 pages