中文

学习统一化自然语言语法

cmp-lg 2016-08-31 v1 计算与语言

摘要

在解析无限制语言时,宽覆盖语法常常会产生欠生成现象。欠生成问题可以通过句子纠正或语法纠正来解决。本论文聚焦于语法自动纠正(或机器学习语法)作为解决欠生成问题的方案。广义地说,语法纠正方法可分为数据驱动型或模型驱动型。数据驱动型学习者使用数据密集型方法获取语法,通常使用不适用于实际文本处理需求的语法形式,无法保证生成的语法在后续语义解释中是充分的。也就是说,数据驱动型学习者获取的语法会生成人类会判断为语法不正确的句子(即会产生过度生成),并无法分配合理的语言学解析。模型驱动型学习者是知识密集型方法,其成功依赖于{\it 语法完整性模型}的完备性。但实际情况下,该模型必然不完备。鉴于本论文关注的是通过学习来解决欠生成问题,我们假设数据驱动学习与模型驱动学习的结合使用可使数据驱动学习弥补模型驱动学习的不完备性,同时模型驱动学习可补偿数据驱动学习的不严谨性。我们描述了一个用于检验该假设的系统。该系统结合了数据驱动与模型驱动学习,以获取更适用于实际文本解析的统一化语法。我们以 Spoken English Corpus 为数据,依据定量测量欠生成、过生成和解析合理性,表明该假设成立。

关键词

引用

@article{arxiv.cmp-lg/9502002,
  title  = {Learning Unification-Based Natural Language Grammars},
  author = {Miles Osborne},
  journal= {arXiv preprint arXiv:cmp-lg/9502002},
  year   = {2016}
}

备注

DPhil thesis, self-unpacking latex file, 114 pages with 33 pages of appendices.