中文

uChecker:作为无监督中文拼写检查器的掩码预训练语言模型

计算与语言 2022-09-16 v1

摘要

中文拼写检查(CSC)任务旨在检测并纠正文本中出现的拼写错误。由于人工标注高质量数据集昂贵且耗时,训练数据集的规模通常很小(例如,SIGHAN15 仅包含 2339 个训练样本),因此基于监督学习的模型通常受到数据稀疏性和过拟合问题的限制,尤其是在大语言模型时代。本文致力于研究解决 CSC 问题的无监督范式,并提出一个名为 uChecker 的框架来进行无监督拼写错误检测与纠正。考虑到掩码预训练语言模型(如 BERT)强大的语言诊断能力,我们将其作为骨干模型。受益于多样且灵活的掩码(MASKing)操作,我们提出了一种混淆集引导的掩码策略来微调掩码语言模型,以进一步提升无监督检测与纠正的性能。在标准数据集上的实验结果表明,我们提出的 uChecker 模型在字符级和句子级的准确率(Accuracy)、精确率(Precision)、召回率(Recall)和 F1 值(F1-Measure)方面,于拼写错误检测与纠正任务上均具有有效性。

关键词

引用

@article{arxiv.2209.07068,
  title  = {uChecker: Masked Pretrained Language Models as Unsupervised Chinese Spelling Checkers},
  author = {Piji Li},
  journal= {arXiv preprint arXiv:2209.07068},
  year   = {2022}
}

备注

COLING2022,11 pages