从字典中学习:异质知识引导的中文拼写检查微调
计算与语言
2022-10-20 v1
摘要
中文拼写检查(CSC)旨在检测并纠正中文拼写错误。近期研究从语言模型的预训练知识出发,将多模态信息引入 CSC 模型以提升性能。然而,它们忽视了字典中丰富的知识——一本可让人学习某字应如何发音、书写与使用的参考书。本文提出 LEAD 框架,使 CSC 模型从字典中学习关于语音、视觉与语义的异质知识。LEAD 首先依据字典中字符语音、字形与释义的知识构造正样本与负样本,随后采用统一的基于对比学习的训练方案来精炼 CSC 模型的表示。在 SIGHAN 基准数据集上的大量实验与细致分析证明了我们所提方法的有效性。
引用
@article{arxiv.2210.10320,
title = {Learning from the Dictionary: Heterogeneous Knowledge Guided Fine-tuning for Chinese Spell Checking},
author = {Yinghui Li and Shirong Ma and Qingyu Zhou and Zhongli Li and Li Yangning and Shulin Huang and Ruiyang Liu and Chao Li and Yunbo Cao and Haitao Zheng},
journal= {arXiv preprint arXiv:2210.10320},
year = {2022}
}
备注
Long paper, accepted at the Findings of EMNLP 2022