中文

迈向韩语语法错误纠正的标准化:数据集与标注

计算与语言 2023-05-25 v3 人工智能

摘要

与英语等其他主要语言相比,韩语语法错误纠正(GEC)的研究较为有限。我们将这一不利状况归因于缺乏精心设计的韩语 GEC 评估基准。在本工作中,我们从不同来源收集了三个数据集(Kor-Lang8、Kor-Native 和 Kor-Learner),涵盖了广泛的韩语语法错误。考虑到韩语语法的特性,我们随后定义了 14 种韩语错误类型,并提供了 KAGAS(Korean Automatic Grammatical error Annotation System,韩语自动语法错误标注系统),该系统可以自动从平行语料库中标注错误类型。我们在我们的数据集上使用 KAGAS 构建了韩语的评估基准,并展示了基于我们数据集训练的基线模型。结果表明,使用我们数据集训练的模型在更广泛的错误类型上显著优于当前使用的统计韩语 GEC 系统(Hanspell),证明了数据集的多样性和实用性。实现代码和数据集已开源。

关键词

引用

@article{arxiv.2210.14389,
  title  = {Towards standardizing Korean Grammatical Error Correction: Datasets and Annotation},
  author = {Soyoung Yoon and Sungjoon Park and Gyuwan Kim and Junhee Cho and Kihyo Park and Gyutae Kim and Minjoon Seo and Alice Oh},
  journal= {arXiv preprint arXiv:2210.14389},
  year   = {2023}
}

备注

Accepted at ACL 2023 (main)