空间标记中的迷失
计算与语言
2022-08-03 v1
摘要
我们考察了在训练子词分词器早期所做的一个决策,即应由词首 token 还是词尾 token 携带特殊标记。基于效率与凝聚力的表层考量以及形态覆盖度,我们发现,在预分词英文文本上训练的 Unigram LM 分词器以标记词首 token 为佳,而在原始文本上训练的分词器则受益于标记词尾。我们的发现可跨领域推广。
引用
@article{arxiv.2208.01561,
title = {Lost in Space Marking},
author = {Cassandra L. Jacobs and Yuval Pinter},
journal= {arXiv preprint arXiv:2208.01561},
year = {2022}
}
备注
Submission to SIGMORPHON 2021