中文

MarkBERT:标注词边界改进中文BERT

计算与语言 2022-10-11 v2

摘要

本文提出一种利用词信息的中文BERT模型,称为MarkBERT。现有基于词的BERT模型将词作为基本单元,然而受限于BERT词表,它们仅覆盖高频词,遇未登录词(OOV)时退化为字级。与现有工作不同,MarkBERT保持词表为汉字,并在连续词间插入边界标记。该设计使模型能以相同方式处理任意词,无论其是否为OOV词。此外,我们的模型还有两项额外益处:其一,便于在标记上添加词级学习目标,与传统字级和句级预训练任务互补;其二,可通过以词性标签专用标记替换通用标记,轻松融入更丰富语义如词性(POS)标签。借助简单的标记插入,MarkBERT可提升包括语言理解与序列标注在内的多种下游任务性能。\footnote{所有代码与模型将公开于\url{https://github.com/daiyongya/markbert}}

关键词

引用

@article{arxiv.2203.06378,
  title  = {MarkBERT: Marking Word Boundaries Improves Chinese BERT},
  author = {Linyang Li and Yong Dai and Duyu Tang and Xipeng Qiu and Zenglin Xu and Shuming Shi},
  journal= {arXiv preprint arXiv:2203.06378},
  year   = {2022}
}

备注

preprint