中文

存在拼写错误时的分词修复

计算与语言 2022-03-24 v2

摘要

我们考虑如下分词修复问题:给定一段自然语言文本,其中缺失或多余空格以任意组合出现,对其修正。拼写错误可以存在,但纠正它们不属于本问题的范畴。例如,给定:“Tispa per isabout token izaionrep air”,计算出“Tis paper is about tokenizaion repair”。我们识别出高质量分词修复的三个关键要素,均为以往工作所缺失:具有双向组件的深度语言模型、在含拼写错误文本上训练模型,以及利用已有的空格信息。我们的方法也改进了现有拼写检查器,不仅修复更多分词错误,还修复更多拼写错误:一旦明确哪些字符构成一个词,它们就更容易确定正确单词。我们提供六个基准,覆盖三种用例(OCR 错误、从 PDF 提取文本、人为错误)以及部分正确空格信息和全部空格缺失的情况。我们针对最佳现有方法及一个非平凡基线评估了我们的方法。我们在 https://ad.cs.uni-freiburg.de/publications 提供完整可复现性。

关键词

引用

@article{arxiv.2010.07878,
  title  = {Tokenization Repair in the Presence of Spelling Errors},
  author = {Hannah Bast and Matthias Hertel and Mostafa M. Mohamed},
  journal= {arXiv preprint arXiv:2010.07878},
  year   = {2022}
}