基于 Winnow 的上下文相关拼写纠正方法
机器学习
2007-05-23 v1 计算与语言
摘要
自然语言中的一大类机器学习问题需要对语言上下文进行刻画。此类问题的两个特征是:其特征空间维度极高,且目标概念仅涉及空间中极少部分特征。在此条件下,诸如 Winnow 的乘性权重更新算法已被证明具有极佳的理论性质。我们提出一种结合 Winnow 变体与加权多数投票的算法,并将其应用于上述类别中的问题:上下文相关拼写纠正。该任务用于修正恰好生成有效单词的拼写错误,例如将“too”误写为“to”、“causal”误写为“casual”等。我们通过将所提算法 WinSpell 与代表该任务当前最优(SOTA)水平的基于统计的方法 BaySpell 进行比较来评估它。我们发现:(1)当使用完整(未剪枝)特征集运行时,WinSpell 的准确率显著高于 BaySpell 在剪枝或未剪枝条件下所能达到的准确率;(2)与文献中其他系统相比,WinSpell 表现出最高性能;(3)WinSpell 优于 BaySpell 的主要原因在于其学到了更好的线性分离器;(4)当在抽取自不同于训练集语料的测试集上运行时,WinSpell 比 BaySpell 更能适应,采用我们将提出的结合训练集上有监督学习与(含噪)测试集上无监督学习的策略。
引用
@article{arxiv.cs/9811003,
title = {A Winnow-Based Approach to Context-Sensitive Spelling Correction},
author = {Andrew R. Golding and Dan Roth},
journal= {arXiv preprint arXiv:cs/9811003},
year = {2007}
}
备注
To appear in Machine Learning, Special Issue on Natural Language Learning, 1999. 25 pages