中文

基于错误一致性预训练的通用语域自适应中文拼写检查

计算与语言 2022-12-08 v3

摘要

标注数据的缺乏是中文拼写检查(CSC)的重要瓶颈之一。现有研究利用无标注数据自动生成以扩充监督语料。然而,真实输入场景与自动生成语料间存在巨大鸿沟。为此,我们开发了具有竞争力的通用拼写器 ECSpell,其采用错误一致性掩码策略为预训练创建数据。该错误一致性掩码策略用于指定自动生成句子的错误类型,与真实场景一致。实验结果表明,我们的模型在通用基准上优于先前的 SOTA 模型。此外,拼写器在真实生活中常工作于特定领域。由于大量不常见领域术语,在我们构建的领域特定数据集上的实验显示通用模型表现极差。受输入法常见实践启发,我们提出添加可变更用户词典以处理零样本领域自适应问题。具体而言,我们将用户词典引导推理模块(UD)附加于基于通用 token 分类的拼写器。我们的实验表明,ECSpellUD^{UD}(即 ECSpell 与 UD 结合)大幅超越所有其他基线,甚至接近通用基准上的性能。

关键词

引用

@article{arxiv.2203.10929,
  title  = {General and Domain Adaptive Chinese Spelling Check with Error Consistent Pretraining},
  author = {Qi Lv and Ziqiang Cao and Lei Geng and Chunhui Ai and Xu Yan and Guohong Fu},
  journal= {arXiv preprint arXiv:2203.10929},
  year   = {2022}
}