中文

MixEdit:重新审视数据增强及超越语法错误校正的方法

计算与语言 2023-10-19 v1

摘要

通过生成伪数据进行数据增强已被证明能有效缓解语法错误校正(GEC)领域中的数据稀缺挑战。各种增强策略已被广泛探索,其中大多数受两种启发式方法驱动,即增加伪数据的分布相似性与多样性。然而,这些策略生效的潜在机制仍知之甚少。本文旨在阐明数据增强如何改进 GEC 模型。为此,我们引入两个可解释且计算高效的度量:亲和性(Affinity)与多样性(Diversity)。我们的发现表明,一种以高亲和性与适当多样性为特征的优秀 GEC 数据增强策略能更好地提升 GEC 模型的性能。基于该观察,我们提出 MixEdit,一种无需额外单语语料库、策略性且动态地增强真实数据的数据增强方法。为验证我们发现的正确性及所提 MixEdit 的有效性,我们在主流的英文与中文 GEC 数据集上进行了实验。结果显示 MixEdit 大幅改进了 GEC 模型,并且与传统数据增强方法互补。

关键词

引用

@article{arxiv.2310.11671,
  title  = {MixEdit: Revisiting Data Augmentation and Beyond for Grammatical Error Correction},
  author = {Jingheng Ye and Yinghui Li and Yangning Li and Hai-Tao Zheng},
  journal= {arXiv preprint arXiv:2310.11671},
  year   = {2023}
}

备注

Accepted to Findings of EMNLP 2023