Baum-Welch再估计是否对标记器有帮助?
cmp-lg
2008-02-03 v2 计算与语言
摘要
在隐马尔可夫模型(HMM)中进行词性标记时,使用统计模型为文本中的单词分配语法类别。早期工作依赖于由人工标注者标记的语料库来训练模型。更近期,Cutting等人(1992)建议可通过使用Baum-Welch再估计,仅以最小词典和有限的先验概率信息即可实现训练,以自动细化模型。本文报告了两项实验,以确定需要多少手动训练信息。第一项实验表明,初始对词汇概率或转移概率的偏向对于实现良好准确率至关重要。第二项实验揭示了Baum-Welch再估计存在三种不同的模式。在两种模式下,再估计最终会降低标记准确率,而非提高。在可预测的模式中,取决于初始模型的质量以及标记训练语料库(如果有的话)与待标记语料库之间的相似性。给出了关于如何以有效方式使用再估计的启发式方法。结论与Merialdo(1994)大体一致,但对模型各部分的贡献给出了更为详尽的细节。
关键词
引用
@article{arxiv.cmp-lg/9410012,
title = {Does Baum-Welch Re-estimation Help Taggers?},
author = {David Elworthy},
journal= {arXiv preprint arXiv:cmp-lg/9410012},
year = {2008}
}
备注
Uses aclap.sty. Appeared in ANLP 94