FlaCGEC:一个具有细粒度语言标注的中文语法纠错数据集
计算与语言
2023-11-10 v1 人工智能
摘要
中文语法纠错(CGEC)近来吸引了研究者越来越多的关注。尽管已开发多个 CGEC 数据集以支持研究,这些数据集缺乏提供语法错误深层语言拓扑的能力,而这对解释和诊断 CGEC 方法至关重要。为应对此局限,我们引入 FlaCGEC,这是一个以细粒度语言标注为特色的新 CGEC 数据集。具体而言,我们从中文语言专家定义的语言模式收集原始语料,通过规则对句子进行编辑,并人工精炼生成的样本,最终得到含 78 个实例化语法点和 3 类编辑的 1 万条句子。我们在所提 FlaCGEC 数据集上评估多种前沿 CGEC 方法,其平平的结果表明该数据集在覆盖大范围语法错误方面具有挑战性。此外,我们还将 FlaCGEC 作为诊断数据集以测试泛化能力,并对现有 CGEC 模型进行了全面评估。
引用
@article{arxiv.2311.04906,
title = {FlaCGEC: A Chinese Grammatical Error Correction Dataset with Fine-grained Linguistic Annotation},
author = {Hanyue Du and Yike Zhao and Qingyuan Tian and Jiani Wang and Lei Wang and Yunshi Lan and Xuesong Lu},
journal= {arXiv preprint arXiv:2311.04906},
year = {2023}
}