SDCL:面向中文拼写纠错的自蒸馏对比学习
计算与语言
2022-11-08 v4 人工智能
摘要
由于同音字的歧义性,中文拼写纠错(CSC)具有广泛的应用。现有系统通常利用 BERT 进行文本编码。然而,CSC 要求模型同时考虑语音和字形信息。为使 BERT 适应 CSC 任务,我们提出了一种词元级自蒸馏对比学习方法。我们使用 BERT 对受损句子及对应的正确句子进行编码。然后,我们利用对比学习损失将受损词元的隐藏状态正则化,使其更接近正确句子中对应的词元。在三个 CSC 数据集上,我们证实了该方法相比基线有显著提升。
引用
@article{arxiv.2210.17168,
title = {SDCL: Self-Distillation Contrastive Learning for Chinese Spell Checking},
author = {Xiaotian Zhang and Hang Yan and Yu Sun and Xipeng Qiu},
journal= {arXiv preprint arXiv:2210.17168},
year = {2022}
}