中文

“全词掩码对中文BERT总是更好吗?”:基于中文语法错误纠正的探测研究

计算与语言 2022-03-03 v2

摘要

全词掩码(WWM)一次性掩码对应一个词的所有子词,可得到更好的英文BERT模型。然而对于中文,由于每个token为原子字符,并不存在子词。中文词的意义不同之处在于词是由多个字符构成的组合单元。这一差异促使我们探究WWM是否能让中文BERT获得更好的上下文理解能力。为此,我们引入两个与语法错误纠正相关的探测任务,要求预训练模型以掩码语言建模方式修订或插入token。我们构建了包含10,448句中19,075个token标签的数据集。我们分别训练了采用标准字符级掩码(CLM)、WWM以及CLM与WWM结合三种策略的中文BERT模型。主要发现如下:第一,当需要插入或替换一个字符时,CLM训练的模型表现最佳;第二,当需处理多于一个字符时,WWM是提升性能的关键;最后,在句子级下游任务微调时,不同掩码策略训练的模型表现相当。

关键词

引用

@article{arxiv.2203.00286,
  title  = {"Is Whole Word Masking Always Better for Chinese BERT?": Probing on Chinese Grammatical Error Correction},
  author = {Yong Dai and Linyang Li and Cong Zhou and Zhangyin Feng and Enbo Zhao and Xipeng Qiu and Piji Li and Duyu Tang},
  journal= {arXiv preprint arXiv:2203.00286},
  year   = {2022}
}

备注

Short paper in Findings of ACL 2022