融合小型与大型模型的中文拼写检查方法
计算与语言
2025-06-10 v1
摘要
在大语言模型(LLMs)时代,中文拼写检查(CSC)任务已涌现出多种基于大语言模型的方法,但其性能仍不尽如人意。相比之下,基于BERT微调的模型依赖高质量领域内数据,展现出优异的性能,但存在编辑模式过拟合的问题。本文提出一种新颖的动态混合方法,在束搜索解码阶段有效结合小型模型与大语言模型的概率分布,实现了小型模型精确纠错能力与大语言模型流畅性的均衡增强。该方法还省去了对大语言模型进行微调的需要,节省了大量时间和资源,并有利于领域适应。综合实验表明,我们的混合方法显著提升了纠错能力,在多个数据集上取得了最先进的结果。我们的代码已开源,地址为:https://github.com/zhqiao-nlp/MSLLM。
引用
@article{arxiv.2506.06887,
title = {Mixture of Small and Large Models for Chinese Spelling Check},
author = {Ziheng Qiao and Houquan Zhou and Zhenghua Li},
journal= {arXiv preprint arXiv:2506.06887},
year = {2025}
}