面向语法错误纠正的大型序列标注器集成与知识蒸馏
计算与语言
2022-03-25 v1
摘要
本文研究对 GEC 序列标注架构的改进,重点在于大配置下近期前沿基于 Transformer 的编码器的集成。我们通过在跨度级编辑上以多数投票鼓励模型集成,因为该方法对模型架构与词表大小具有容错性。我们的最佳集成在 BEA-2019(测试集)上以 分数 76.05 取得了新的 SOTA 结果,即便未在水合成数据集上预训练。此外,我们利用训练好的集成进行知识蒸馏,生成新的合成训练数据集“Troy-Blogs”与“Troy-1BW”。我们最佳的单一序列标注模型在生成的 Troy 数据集与公开可用的合成 PIE 数据集上预训练后,取得了接近 SOTA 的结果(据我们所知,我们的最佳单一模型仅让位于重得多的 T5 模型结果,在 BEA-2019(测试集)上 分数为 73.21。代码、数据集与训练模型均已公开可用)。
引用
@article{arxiv.2203.13064,
title = {Ensembling and Knowledge Distilling of Large Sequence Taggers for Grammatical Error Correction},
author = {Maksym Tarnavskyi and Artem Chernodub and Kostiantyn Omelianchuk},
journal= {arXiv preprint arXiv:2203.13064},
year = {2022}
}