中文

SDCL:面向中文拼写纠错的自蒸馏对比学习

计算与语言 2022-11-08 v4 人工智能

摘要

由于同音字的歧义性,中文拼写纠错(CSC)具有广泛的应用。现有系统通常利用 BERT 进行文本编码。然而,CSC 要求模型同时考虑语音和字形信息。为使 BERT 适应 CSC 任务,我们提出了一种词元级自蒸馏对比学习方法。我们使用 BERT 对受损句子及对应的正确句子进行编码。然后,我们利用对比学习损失将受损词元的隐藏状态正则化,使其更接近正确句子中对应的词元。在三个 CSC 数据集上,我们证实了该方法相比基线有显著提升。

关键词

引用

@article{arxiv.2210.17168,
  title  = {SDCL: Self-Distillation Contrastive Learning for Chinese Spell Checking},
  author = {Xiaotian Zhang and Hang Yan and Yu Sun and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2210.17168},
  year   = {2022}
}