中文

从字符到词:面向开放词表语言理解的层次化预训练语言模型

计算与语言 2023-05-31 v2

摘要

当前自然语言理解的最优模型需要预处理步骤将原始文本转换为离散词元。这一称为分词的过程依赖于预先构建的由词或子词语素组成的词表。这种固定词表限制了模型对拼写错误的鲁棒性及其适应新领域的能力。在本文中,我们引入一种新颖的开放词表语言模型,采用层次化两级方法:一级在词级别,另一级在序列级别。具体而言,我们设计了一个词内模块,使用浅层 Transformer 架构从字符学习词表示,以及一个深层词间 Transformer 模块,通过关注整个词序列来对每个词表示进行上下文化。因此,我们的模型直接在字符序列上运行,具有显式的词边界感知,但无偏置的子词或词级词表。在多个下游任务上的实验表明,我们的方法优于强基线。我们还证明了我们的层次化模型对文本损坏和领域偏移具有鲁棒性。

关键词

引用

@article{arxiv.2305.14571,
  title  = {From Characters to Words: Hierarchical Pre-trained Language Model for Open-vocabulary Language Understanding},
  author = {Li Sun and Florian Luisier and Kayhan Batmanghelich and Dinei Florencio and Cha Zhang},
  journal= {arXiv preprint arXiv:2305.14571},
  year   = {2023}
}

备注

Accepted to ACL 2023 Main Conference