中文

利用具有有限成分信息的训练数据的有监督语法归纳

计算与语言 2007-05-23 v1

摘要

基于语料的语法归纳通常依赖人工解析的训练数据来学习语言结构。遗憾的是,构建大型标注语料库的成本高得令人却步。本研究旨在当训练数据中标签很少时改进归纳策略。我们表明,信息量最大的语言成分是无分析树中的较高节点,通常指代复杂名词短语与句子子句。它们仅占所有成分的 20%。对于从稀疏标注训练数据(例如仅含高层成分标签)中归纳语法,我们提出了一种自适应策略,其生成的语法解析效果几乎与从完全标注语料库归纳出的语法一样好。我们的结果表明,要让一个局部解析器替代人类标注者,它必须能够自动抽取高层成分而非基本名词短语。

关键词

引用

@article{arxiv.cs/9905001,
  title  = {Supervised Grammar Induction Using Training Data with Limited Constituent Information},
  author = {Rebecca Hwa},
  journal= {arXiv preprint arXiv:cs/9905001},
  year   = {2007}
}

备注

7 pages, 2 figures, to appear in the proc. of ACL '99