中文

零样跨语言迁移用于语法错误检测中的合成数据生成

计算与语言 2024-07-17 v1 人工智能

摘要

语法错误检测(GED)方法高度依赖人工标注的错误语料。然而,这些标注在许多低资源语言中不可得。本文探讨了此背景下的GED问题。利用多语言预训练模型的零样跨语言迁移能力,我们训练模型以来自多种语言的数据生成其他语言的合成错误。这些合成错误语料随后用于训练GED模型。具体而言,我们提出了两阶段微调流程:首先在目标语言的多语言合成数据上微调GED模型,然后在源语言的人工标注GED语料上进行微调。该方法优于当前现有的无标注GED方法。我们还分析了本方法和其他强大基线产生的错误,发现本方法生成的错误更具多样性且更接近人类错误。

关键词

引用

@article{arxiv.2407.11854,
  title  = {Zero-shot Cross-Lingual Transfer for Synthetic Data Generation in Grammatical Error Detection},
  author = {Gaetan Lopez Latouche and Marc-André Carbonneau and Ben Swanson},
  journal= {arXiv preprint arXiv:2407.11854},
  year   = {2024}
}

备注

Submitted to EMNLP 2024