中文拼写检查模型领域适应能力的实证研究
计算与语言
2024-01-29 v1 人工智能
摘要
中文拼写检查(CSC)是自然语言处理(NLP)领域一项有意义任务,旨在检测中文文本中的拼写错误并加以纠正。然而,CSC模型基于在通用语料库上训练的预训练语言模型。因此,当面对涉及特定领域术语的下游任务时,其性能可能会下降。本文通过构建三个包含金融、医疗和法律领域丰富特定领域术语的新数据集,对各种典型CSC模型的领域适应能力进行了全面评估。随后,我们在相应的特定领域测试数据集上进行实证研究,以确定几种典型CSC模型的跨领域适应能力。我们还测试了流行的大语言模型ChatGPT的性能。实验结果表明,CSC模型在新领域中的性能显著下降。
引用
@article{arxiv.2401.14630,
title = {An Empirical Investigation of Domain Adaptation Ability for Chinese Spelling Check Models},
author = {Xi Wang and Ruoqing Zhao and Hongliang Dai and Piji Li},
journal= {arXiv preprint arXiv:2401.14630},
year = {2024}
}
备注
ICASSP2024