中文

通过逐层注意力与高斯混合模型增强基于 BERT 的中文拼写检查模型

计算与语言 2023-12-29 v1

摘要

基于 BERT 的模型最近在中文拼写检查(CSC)任务中表现出卓越的能力。然而,传统的基于 BERT 的方法仍存在两个局限性。首先,尽管先前的工作已识别出显式先验知识(如词性(POS)标注)有利于 CSC 任务,但他们忽视了 CSC 数据中固有的拼写错误可能导致标签错误从而误导模型的事实。此外,他们忽略了 BERT 中间层编码的隐式层次信息与不同语言现象之间的相关性。这导致了次优的准确率。为了缓解上述两个问题,我们设计了一个异构知识注入框架以增强基于 BERT 的 CSC 模型。为了融入显式 POS 知识,我们利用由高斯混合模型驱动的辅助任务策略。同时,为了融入编码器内的隐式层次语言知识,我们提出了一种新颖的基于 n-gram 的逐层自注意力形式,以生成多层表示。实验结果表明,我们提出的框架在四个强基线模型上产生了稳定的性能提升,并在两个数据集上优于之前的最先进方法。

关键词

引用

@article{arxiv.2312.16623,
  title  = {Make BERT-based Chinese Spelling Check Model Enhanced by Layerwise Attention and Gaussian Mixture Model},
  author = {Yongchang Cao and Liang He and Zhen Wu and Xinyu Dai},
  journal= {arXiv preprint arXiv:2312.16623},
  year   = {2023}
}

备注

10 pages, 4 figures, 2023 International Joint Conference on Neural Networks (IJCNN)