中文

面向端到端任务学习的无词表多语言神经分词器

计算与语言 2022-04-25 v1 人工智能

摘要

子词分词是近期大多数NLP模型中常用的输入预处理步骤。然而,它限制了模型利用端到端任务学习的能力。其基于频率的词表创建损害了低资源语言中的分词效果,导致模型产生次优表示。此外,对固定词表的依赖限制了子词模型跨语言和跨领域的适应性。在本工作中,我们通过从基于启发式的子词分词中蒸馏分割信息,提出了一种无词表神经分词器。我们通过处理多语言语料中的独特词来预训练基于字符的分词器,从而广泛增加跨语言的词汇多样性。与子词方法中预定义且固定的词表不同,我们的分词器允许端到端任务学习,从而产生最优的任务特定分词。实验结果表明,在多语言(NLI)和语码转换(情感分析)任务上,用我们的神经分词器替换子词分词器可持续提升性能,在低资源语言中提升更大。此外,当存在对抗性噪声(错别字和拼写错误)时,我们的神经分词器在下游任务上表现出稳健性能,进一步增加了相对于统计子词分词器的初始改进。

关键词

引用

@article{arxiv.2204.10815,
  title  = {A Vocabulary-Free Multilingual Neural Tokenizer for End-to-End Task Learning},
  author = {Md Mofijul Islam and Gustavo Aguilar and Pragaash Ponnusamy and Clint Solomon Mathialagan and Chengyuan Ma and Chenlei Guo},
  journal= {arXiv preprint arXiv:2204.10815},
  year   = {2022}
}