利用自动生成的词层次结构提升统计语言模型性能
cmp-lg
2016-08-31 v1 计算与语言
摘要
设计了一个自动词分类系统,处理从自然语言话语语料库中提取的一元和二元频率统计。该系统实现了一种采用平均类互信息度量的二叉自顶向下词聚类方式。所得分类是层次化的,允许可变类粒度。词以结构标签表示——唯一的 位数字,其最高有效位模式包含类信息。访问结构标签可立即获取对应词的所有分类层级。该分类系统成功揭示了英语从音位层到语义层的部分结构。该系统已与其他近期词分类系统进行了直接和间接的比较。基于类的插值语言模型已被构建以利用分类提供的额外信息,一些实验表明新模型改善了模型性能。
引用
@article{arxiv.cmp-lg/9503011,
title = {Improving Statistical Language Model Performance with Automatically Generated Word Hierarchies},
author = {John McMahon and F. J. Smith},
journal= {arXiv preprint arXiv:cmp-lg/9503011},
year = {2016}
}
备注
17 Page Paper. Self-extracting PostScript File