上下文是关键:基于上下文词表示的语法错误检测
计算与语言
2020-05-04 v2 机器学习
摘要
非母语写作中的语法错误检测(GED)要求系统识别语言学习者所写文本中广泛的错误。将错误检测作为纯监督任务可能具有挑战性,因为 GED 数据集规模有限且标签分布高度不平衡。上下文词表示提供了一种可能的解决方案,因为它们能有效捕捉语言中的组合信息,并可在大量无监督数据上优化。在本文中,我们在多个公开 GED 数据集上系统比较了 ELMo、BERT 和 Flair 嵌入(Peters et al., 2017; Devlin et al., 2018; Akbik et al., 2018),并提出了一种将这些表示有效集成到当前方法中的方案,在 GED 上达到了新的 SOTA。我们进一步分析了不同上下文嵌入在该任务上的优势与不足,并详细分析了它们对不同类型错误的影响。
引用
@article{arxiv.1906.06593,
title = {Context is Key: Grammatical Error Detection with Contextual Word Representations},
author = {Samuel Bell and Helen Yannakoudakis and Marek Rei},
journal= {arXiv preprint arXiv:1906.06593},
year = {2020}
}