一种用于中文拼写纠错的错误引导校正模型
计算与语言
2023-03-21 v2 人工智能
摘要
尽管现有的神经网络方法在中文拼写纠错上已取得很大成功,仍有改进空间。模型需要避免过纠正,并区分正确词元与其音似和形似的词元。本文提出一种错误引导校正模型(EGCM)来改进中文拼写纠错。借助 BERT 的强大能力,我们提出一种新颖的零样本错误检测方法来做初步检测,该方法引导我们的模型在编码时更多关注可能错误的词元,并在生成时避免修改正确词元。此外,我们引入一种新的损失函数以整合错误混淆集,使模型能够区分易被误用的词元。而且,我们的模型支持高度并行解码以满足实际应用场景需求。实验在广泛使用的基准上进行。我们的模型在纠错质量和计算速度上均以显著优势优于最先进(SOTA)方法。
引用
@article{arxiv.2301.06323,
title = {An Error-Guided Correction Model for Chinese Spelling Error Correction},
author = {Rui Sun and Xiuyu Wu and Yunfang Wu},
journal= {arXiv preprint arXiv:2301.06323},
year = {2023}
}