从语料库自动提取动词次范畴分类信息
cmp-lg
2016-08-31 v1 计算与语言
摘要
本文描述了一种从文本语料库构建次范畴分类词典的新型技术及实现系统。每个词典条目编码了一组全面的英语次范畴分类类别的相对出现频率。一项初步实验在 14 个展现多种配价模式的动词样本上进行,结果表明该技术的准确度与先前方法相当,而先前方法均局限于高度受限的次范畴分类类别集合。本文还展示了使用该系统构建的次范畴分类词典能够显著提升解析器的准确度。
引用
@article{arxiv.cmp-lg/9702002,
title = {Automatic Extraction of Subcategorization from Corpora},
author = {Ted Briscoe and John Carroll},
journal= {arXiv preprint arXiv:cmp-lg/9702002},
year = {2016}
}
备注
8 pages; requires aclap.sty. To appear in ANLP-97