NaSGEC:一个源自母语者文本的多领域中文语法纠错数据集
计算与语言
2023-05-26 v1
摘要
我们介绍 NaSGEC,一个用于促进面向多领域母语者文本的中文语法纠错(CGEC)研究的新数据集。以往的 CGEC 研究主要聚焦于单一领域文本(尤其是学习者作文)的纠错。为拓宽目标领域,我们为来自三个母语领域(即社交媒体、科学写作与考试)的 12,500 个句子标注了多个参考修正。我们采用前沿 CGEC 模型与不同训练数据,为 NaSGEC 提供了可靠的基准结果。我们进一步从经验与统计双视角详细分析了各领域间的联系与差距。希望本工作能启发未来对一个重要但未被充分探索方向——跨领域 GEC 的研究。
引用
@article{arxiv.2305.16023,
title = {NaSGEC: a Multi-Domain Chinese Grammatical Error Correction Dataset from Native Speaker Texts},
author = {Yue Zhang and Bo Zhang and Haochen Jiang and Zhenghua Li and Chen Li and Fei Huang and Min Zhang},
journal= {arXiv preprint arXiv:2305.16023},
year = {2023}
}
备注
Accepted by ACL 2023 (Findings, long paper)