uChecker:作为无监督中文拼写检查器的掩码预训练语言模型
计算与语言
2022-09-16 v1
摘要
中文拼写检查(CSC)任务旨在检测并纠正文本中出现的拼写错误。由于人工标注高质量数据集昂贵且耗时,训练数据集的规模通常很小(例如,SIGHAN15 仅包含 2339 个训练样本),因此基于监督学习的模型通常受到数据稀疏性和过拟合问题的限制,尤其是在大语言模型时代。本文致力于研究解决 CSC 问题的无监督范式,并提出一个名为 uChecker 的框架来进行无监督拼写错误检测与纠正。考虑到掩码预训练语言模型(如 BERT)强大的语言诊断能力,我们将其作为骨干模型。受益于多样且灵活的掩码(MASKing)操作,我们提出了一种混淆集引导的掩码策略来微调掩码语言模型,以进一步提升无监督检测与纠正的性能。在标准数据集上的实验结果表明,我们提出的 uChecker 模型在字符级和句子级的准确率(Accuracy)、精确率(Precision)、召回率(Recall)和 F1 值(F1-Measure)方面,于拼写错误检测与纠正任务上均具有有效性。
引用
@article{arxiv.2209.07068,
title = {uChecker: Masked Pretrained Language Models as Unsupervised Chinese Spelling Checkers},
author = {Piji Li},
journal= {arXiv preprint arXiv:2209.07068},
year = {2022}
}
备注
COLING2022,11 pages