基于混合粒度加权训练的语法错误纠正
计算与语言
2023-11-27 v1
摘要
语法错误纠正(GEC)任务旨在自动修正自然文本中的语法错误。几乎所有先前工作都平等对待标注训练数据,却忽视了数据间固有的差异。本文将这种固有差异体现为两方面,即数据标注的准确性与潜在标注的多样性。为此,我们提出 MainGEC,其依据数据标注准确性与潜在多样性分别设计词元级与句子级训练权重,进而进行混合粒度加权训练以提升 GEC 的训练效果。实证评估表明,无论在 Seq2Seq 还是 Seq2Edit 方式下,MainGEC 在两个基准数据集上均取得一致且显著的性能提升,证明了混合粒度加权训练的有效性与优越性。进一步的消融实验验证了 MainGEC 中两种粒度设计权重的有效性。
引用
@article{arxiv.2311.13848,
title = {Grammatical Error Correction via Mixed-Grained Weighted Training},
author = {Jiahao Li and Quan Wang and Chiwei Zhu and Zhendong Mao and Yongdong Zhang},
journal= {arXiv preprint arXiv:2311.13848},
year = {2023}
}
备注
EMNLP2023 Findings