中文

中文拼写检查模型领域适应能力的实证研究

计算与语言 2024-01-29 v1 人工智能

摘要

中文拼写检查(CSC)是自然语言处理(NLP)领域一项有意义任务,旨在检测中文文本中的拼写错误并加以纠正。然而,CSC模型基于在通用语料库上训练的预训练语言模型。因此,当面对涉及特定领域术语的下游任务时,其性能可能会下降。本文通过构建三个包含金融、医疗和法律领域丰富特定领域术语的新数据集,对各种典型CSC模型的领域适应能力进行了全面评估。随后,我们在相应的特定领域测试数据集上进行实证研究,以确定几种典型CSC模型的跨领域适应能力。我们还测试了流行的大语言模型ChatGPT的性能。实验结果表明,CSC模型在新领域中的性能显著下降。

关键词

引用

@article{arxiv.2401.14630,
  title  = {An Empirical Investigation of Domain Adaptation Ability for Chinese Spelling Check Models},
  author = {Xi Wang and Ruoqing Zhao and Hongliang Dai and Piji Li},
  journal= {arXiv preprint arXiv:2401.14630},
  year   = {2024}
}

备注

ICASSP2024