使用回译模型的语法错误纠正比较
计算与语言
2021-04-19 v1
摘要
语法错误纠正(GEC)受限于缺乏充足的平行数据。因此,GEC 研究已开发多种方法生成伪数据,即由语法正确句与人工生成的语法错误句组成的句对。当前生成伪数据的主流方法是回译(BT)。多数既往使用 BT 的 GEC 研究对 GEC 与 BT 模型采用相同架构。然而,GEC 模型因其架构不同而有不同的纠正倾向。故此,本研究比较在由不同 BT 模型(即 Transformer、CNN 与 LSTM)生成的伪数据上训练的 GEC 模型的纠正倾向。结果证实,各错误类型的纠正倾向因 BT 模型而异。此外,我们考察了使用由不同 BT 模型生成的伪数据组合时的纠正倾向。结果发现,与不同随机种子的单一 BT 模型相比,不同 BT 模型的组合改善或插值了各错误类型的 F_0.5 分数。
引用
@article{arxiv.2104.07848,
title = {Comparison of Grammatical Error Correction Using Back-Translation Models},
author = {Aomi Koyama and Kengo Hotate and Masahiro Kaneko and Mamoru Komachi},
journal= {arXiv preprint arXiv:2104.07848},
year = {2021}
}
备注
10 pages; camera-ready for NAACL Student Research Workshop 2021