中文

空间标记中的迷失

计算与语言 2022-08-03 v1

摘要

我们考察了在训练子词分词器早期所做的一个决策,即应由词首 token 还是词尾 token 携带特殊标记。基于效率与凝聚力的表层考量以及形态覆盖度,我们发现,在预分词英文文本上训练的 Unigram LM 分词器以标记词首 token 为佳,而在原始文本上训练的分词器则受益于标记词尾。我们的发现可跨领域推广。

关键词

引用

@article{arxiv.2208.01561,
  title  = {Lost in Space Marking},
  author = {Cassandra L. Jacobs and Yuval Pinter},
  journal= {arXiv preprint arXiv:2208.01561},
  year   = {2022}
}

备注

Submission to SIGMORPHON 2021