C-LLM:面向中文拼写错误的字符级检查
计算与语言
2024-10-29 v2
摘要
中文拼写检查(CSC)旨在检测和纠正句子中的拼写错误。尽管大型语言模型(LLM)在各类任务中展现出强大的能力并得到广泛应用,但其在 CSC 任务上的表现往往令人不满意。我们发现 LLM 无法满足 CSC 任务中中文字符级别的约束,即等长与音近,这导致了性能瓶颈。进一步分析表明,这一问题源于 tokenization 的粒度,由于当前混合字符-词 tokenization 难以满足字符级别的约束。为解决此问题,我们提出了 C-LLM,一种基于大型语言模型的字符级检查中文拼写错误的方法。字符级 tokenization 使模型能够学习字符级对齐,有效缓解与字符级别约束相关的问题。此外,将 CSC 简化为复制支配与替换补充任务。在两个 CSC 基准数据集上的实验表明,C-LLM 在现有方法上平均提升约 10%。具体而言,在通用场景下提升 2.1%,在垂直领域场景下提升显著的 12%,建立了 state-of-the-art 的性能。源代码可在 https://github.com/ktlKTL/C-LLM 查阅。
引用
@article{arxiv.2406.16536,
title = {C-LLM: Learn to Check Chinese Spelling Errors Character by Character},
author = {Kunting Li and Yong Hu and Liang He and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2406.16536},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main