中文

从字典中学习:异质知识引导的中文拼写检查微调

计算与语言 2022-10-20 v1

摘要

中文拼写检查(CSC)旨在检测并纠正中文拼写错误。近期研究从语言模型的预训练知识出发,将多模态信息引入 CSC 模型以提升性能。然而,它们忽视了字典中丰富的知识——一本可让人学习某字应如何发音、书写与使用的参考书。本文提出 LEAD 框架,使 CSC 模型从字典中学习关于语音、视觉与语义的异质知识。LEAD 首先依据字典中字符语音、字形与释义的知识构造正样本与负样本,随后采用统一的基于对比学习的训练方案来精炼 CSC 模型的表示。在 SIGHAN 基准数据集上的大量实验与细致分析证明了我们所提方法的有效性。

关键词

引用

@article{arxiv.2210.10320,
  title  = {Learning from the Dictionary: Heterogeneous Knowledge Guided Fine-tuning for Chinese Spell Checking},
  author = {Yinghui Li and Shirong Ma and Qingyu Zhou and Zhongli Li and Li Yangning and Shulin Huang and Ruiyang Liu and Chao Li and Yunbo Cao and Haitao Zheng},
  journal= {arXiv preprint arXiv:2210.10320},
  year   = {2022}
}

备注

Long paper, accepted at the Findings of EMNLP 2022