FCGEC:面向中文语法纠错的高质量细粒度语料库
计算与语言
2023-08-08 v1
摘要
语法纠错(GEC)近年来已广泛应用于自动校正与校对系统。然而,由于来自母语者在类别和规模上的高质量中文数据有限,中文 GEC 仍不成熟。本文中,我们提出 FCGEC,一个用于检测、识别和纠正语法错误的细粒度语料库。FCGEC 是一个带多重参考答案的人工标注语料库,由主要从公立学校语文考试选择题中收集的 41,340 个句子组成。此外,我们提出一种 Switch-Tagger-Generator(STG)基线模型,用于在低资源环境下纠正语法错误。与其他 GEC 基准模型相比,实验结果表明 STG 在我们的 FCGEC 上优于它们。然而,基准模型与人类之间存在显著差距,有待未来模型弥补。
引用
@article{arxiv.2210.12364,
title = {FCGEC: Fine-Grained Corpus for Chinese Grammatical Error Correction},
author = {Lvxiaowei Xu and Jianwang Wu and Jiawei Peng and Jiayu Fu and Ming Cai},
journal= {arXiv preprint arXiv:2210.12364},
year = {2023}
}
备注
Long paper, accepted at the Findings of EMNLP 2022