中文

看,只要 400 个样本!重访 Filipino 拼写规范化中自动 N-Gram 规则生成的有效性

计算与语言 2022-11-08 v2

摘要

随着 8475 万菲律宾人上网,模型处理在线文本的能力对于开发 Filipino 自然语言处理应用至关重要。为此,拼写纠正作为下游处理的预处理步骤十分关键。然而,数据匮乏阻碍了语言模型在该任务上的使用。本文中,我们提出一种带自动规则提取的 N-Gram + Damerau Levenshtein 距离模型。我们在 300 个样本上训练模型,并表明尽管训练数据有限,它仍取得了良好性能,并在准确率和编辑距离上优于其他深度学习方法。此外,该模型 (1) 需要少量计算力,(2) 训练耗时短,从而允许重新训练,以及 (3) 易于解释,允许直接排查问题,凸显了在数据不可用场景下传统方法相对于更复杂深度学习模型的成功。

关键词

引用

@article{arxiv.2210.02675,
  title  = {Look Ma, Only 400 Samples! Revisiting the Effectiveness of Automatic N-Gram Rule Generation for Spelling Normalization in Filipino},
  author = {Lorenzo Jaime Yu Flores and Dragomir Radev},
  journal= {arXiv preprint arXiv:2210.02675},
  year   = {2022}
}

备注

4 pages, 1 figure, Presented at EMNLP 2022 Third Workshop on Simple and Efficient Natural Language Processing