中文

GitHub 拼写错误语料库:一个大规模多语言错拼与语法错误数据集

计算与语言 2019-12-02 v1

摘要

大规模数据集的缺乏一直是拼写纠正与语法错误纠正(GEC)等 NLP 任务发展的主要障碍。作为这些任务的补充性新资源,我们提出了 GitHub 拼写错误语料库(GitHub Typo Corpus),这是一个从 GitHub(一个大型且流行的 git 仓库托管与共享平台)采集的大规模多语言错拼与语法错误及其纠正的数据集。该数据集已公开,包含超过 15 种语言中的 35 万余次编辑与 6500 万字符,是迄今最大的错拼数据集。我们还描述了基于小规模标注子集上的学习分类器来筛选真实拼写错误编辑的过程,并证明使用一个仅含三个特征的极简分类器即可以 F1 ~ 0.9 识别拼写错误编辑。对该数据集的详细分析表明,现有拼写纠正器仅达到约 0.5 的 F 值,说明该数据集可作为补充现有数据集的丰富拼写错误新来源。

关键词

引用

@article{arxiv.1911.12893,
  title  = {GitHub Typo Corpus: A Large-Scale Multilingual Dataset of Misspellings and Grammatical Errors},
  author = {Masato Hagiwara and Masato Mita},
  journal= {arXiv preprint arXiv:1911.12893},
  year   = {2019}
}

备注

Submitted at LREC 2020