中文

大规模合成数据用于语法错误纠正的评估

计算与语言 2022-11-01 v1 人工智能

摘要

语法错误纠正(GEC)主要依赖于大量高质量的合成平行数据,即语法正确与错误句子对。合成数据的质量通过GEC系统使用其进行预训练时的表现来评估。但这并不能深入揭示定义这些数据质量的必要因素。因此,本工作旨在引入3个指标——可靠性、多样性和分布匹配,以深入洞察为GEC任务生成的大规模合成数据的质量,并自动对其评估。自动评估这三个指标还有助于为数据生成系统提供反馈,从而动态提升所生成合成数据的质量。

关键词

引用

@article{arxiv.2210.17035,
  title  = {Evaluation of large-scale synthetic data for Grammar Error Correction},
  author = {Vanya Bannihatti Kumar},
  journal= {arXiv preprint arXiv:2210.17035},
  year   = {2022}
}