LM-Critic:用于无监督语法错误纠正的语言模型
计算与语言
2021-10-11 v2 机器学习
摘要
训练语法错误纠正(GEC)模型需要一组带标注的不合语法/合语法句子对,但人工标注此类句子对代价高昂。近来,Break-It-Fix-It(BIFI)框架在学习修复破损程序而无需任何标注样本方面展现了强劲性能,但其依赖于一个完美的评判器(如编译器)来返回示例是否有效,而 GEC 任务中并不存在这样的评判器。本工作中,我们展示如何利用预训练语言模型(LM)来定义 LM-Critic,若 LM 赋予某句子的概率高于其局部扰动,则判定该句子合乎语法。我们将此 LM-Critic 与 BIFI 以及大量无标注句子结合,以自举出真实的用于训练纠正器的不合语法/合语法句子对。我们在多个领域的 GEC 数据集(CoNLL-2014、BEA-2019、GMEG-wiki 与 GMEG-yahoo)上评估了我们的方法,并表明其在无监督设定(+7.7 F0.5)与有监督设定(+0.5 F0.5)下均优于现有方法。
引用
@article{arxiv.2109.06822,
title = {LM-Critic: Language Models for Unsupervised Grammatical Error Correction},
author = {Michihiro Yasunaga and Jure Leskovec and Percy Liang},
journal= {arXiv preprint arXiv:2109.06822},
year = {2021}
}
备注
EMNLP 2021. Code & data available at https://github.com/michiyasunaga/LM-Critic