通过汉字发音预测改进中文拼写检查:自适应与粒度的影响
计算与语言
2022-10-21 v1
摘要
中文拼写检查(CSC)是一项基础 NLP 任务,用于检测并纠正中文文本中的拼写错误。由于此类拼写错误大多由语音相似性引起,有效建模汉字发音是 CSC 的关键。本文考虑引入汉字发音预测(CPP)辅助任务以改进 CSC,并首次系统讨论了该辅助任务的自适应性与粒度。我们提出 SCOPE,其在共享编码器之上构建两个并行解码器,一个用于主 CSC 任务,另一个用于细粒度辅助 CPP 任务,并采用一种新颖的自适应加权方案来平衡两项任务。此外,我们设计了一种精细的迭代纠正策略以在推理时进一步提升效果。实证评估表明,SCOPE 在三个 CSC 基准上取得了新的最先进结果,证明了辅助 CPP 任务的有效性与优越性。全面的消融研究进一步验证了任务自适应与粒度的正向作用。本文所用代码与数据公开于 https://github.com/jiahaozhenbang/SCOPE。
引用
@article{arxiv.2210.10996,
title = {Improving Chinese Spelling Check by Character Pronunciation Prediction: The Effects of Adaptivity and Granularity},
author = {Jiahao Li and Quan Wang and Zhendong Mao and Junbo Guo and Yanyan Yang and Yongdong Zhang},
journal= {arXiv preprint arXiv:2210.10996},
year = {2022}
}
备注
To appear at the main conference of EMNLP 2022