从模型校准视角精炼中文拼写纠错语料库
计算与语言
2024-07-23 v1
摘要
中文拼写纠错(CSC)通常缺乏大规模高质量语料库,因为在真实人类书写或打字场景中标注拼写错误需要大量人力。两种数据增强方法被广泛采用:(1)在混淆集指导下的\emph{随机替换}和(2)模拟字符误用的\emph{基于OCR/ASR的生成}。然而,这两种方法都不可避免地引入噪声数据(例如,错误的拼写错误),可能导致过度纠错。通过仔细分析这两类语料库,我们发现,尽管后者能实现更鲁棒的泛化性能,但前者能产生校准得更好的CSC模型。然后,我们对这一经验观察进行了理论分析,并基于此提出了一种语料库精炼策略。具体来说,将基于OCR/ASR的数据样本输入到一个在基于随机替换的语料库上训练好的、校准良好的CSC模型中,然后根据预测置信度进行过滤。通过在精炼后的OCR/ASR语料库上学习一个简单的基于BERT的模型,我们在三个广泛使用的基准测试集上取得了令人瞩目的最先进性能,同时显著减轻了过度校正(例如,降低了假阳性预测)。
引用
@article{arxiv.2407.15498,
title = {Refining Corpora from a Model Calibration Perspective for Chinese Spelling Correction},
author = {Dingyao Yu and Yang An and Wei Ye and Xiongfeng Xiao and Shaoguang Mao and Tao Ge and Shikun Zhang},
journal= {arXiv preprint arXiv:2407.15498},
year = {2024}
}