中文

评估语法错误纠正的效能:日本语境下的人工评估方法

计算与语言 2024-03-01 v2

摘要

在本研究中,我们使用日本大学生的写作样本来评估最先进的序列标记语法错误检测与纠正模型 (SeqTagger) 的性能。利用自动标注工具 ERRANT,我们首先以人工专家纠正为基准评估了 SeqTagger 在错误纠正方面的性能。随后,采用人工标注方法,利用写作数据集的一个子集评估了 SeqTagger 在错误检测方面的性能。结果表明,在全量数据集中,错误纠正的精确率为 63.66%,召回率为 20.19%。对于子集,在手动排除语义和机械性等无关错误后,模型在错误检测方面的调整后精确率为 97.98%,调整后召回率为 42.98%,这表明模型具有高准确性,但也具有保守性。对模型未检测到的错误进行主题分析显示,限定词和冠词(尤其是后者)占主导地位。具体而言,就与上下文无关的错误而言,模型偶尔会忽略基本错误,并且在处理错误过多或结构复杂的句子时面临挑战。同时,依赖于上下文的错误,特别是与时态和名词数相关的错误,以及可能受学生第一语言 (L1) 影响的错误,仍然特别具有挑战性。

关键词

引用

@article{arxiv.2402.18101,
  title  = {Assessing the Efficacy of Grammar Error Correction: A Human Evaluation Approach in the Japanese Context},
  author = {Qiao Wang and Zheng Yuan},
  journal= {arXiv preprint arXiv:2402.18101},
  year   = {2024}
}

备注

2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)