大规模合成数据用于语法错误纠正的评估
计算与语言
2022-11-01 v1 人工智能
摘要
语法错误纠正(GEC)主要依赖于大量高质量的合成平行数据,即语法正确与错误句子对。合成数据的质量通过GEC系统使用其进行预训练时的表现来评估。但这并不能深入揭示定义这些数据质量的必要因素。因此,本工作旨在引入3个指标——可靠性、多样性和分布匹配,以深入洞察为GEC任务生成的大规模合成数据的质量,并自动对其评估。自动评估这三个指标还有助于为数据生成系统提供反馈,从而动态提升所生成合成数据的质量。
引用
@article{arxiv.2210.17035,
title = {Evaluation of large-scale synthetic data for Grammar Error Correction},
author = {Vanya Bannihatti Kumar},
journal= {arXiv preprint arXiv:2210.17035},
year = {2022}
}