中文

评估子词分词:异类子词组合与OOV泛化挑战

计算与语言 2024-04-23 v1 人工智能

摘要

当前语言模型中流行的子词分词器,如字节对编码(BPE),已知不尊重语素边界,这影响了模型的下游性能。尽管已经提出了许多改进的分词算法,但它们的评估和交叉比较仍然是一个开放问题。作为解决方案,我们提出了一个结合内在-外在评估框架的子词分词评估方法。内在评估基于我们新的UniMorph Labeller工具,该工具将子词分词分类为形态学或异类。外在评估则通过词汇外泛化挑战1.0基准进行,该基准由三个新指定的下游文本分类任务组成。我们的实证结果表明,UniMorph Labeller的准确率为98%,并且在所有研究的语言模型(包括ALBERT、BERT、RoBERTa和DeBERTa)中,对于词义的语义组合性,异类分词导致比形态学分词更差的泛化能力。

关键词

引用

@article{arxiv.2404.13292,
  title  = {Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge},
  author = {Khuyagbaatar Batsuren and Ekaterina Vylomova and Verna Dankers and Tsetsuukhei Delgerbaatar and Omri Uzan and Yuval Pinter and Gábor Bella},
  journal= {arXiv preprint arXiv:2404.13292},
  year   = {2024}
}