中文

Wine 不是 v i n——论跨语言分词方案的兼容性

计算与语言 2021-09-14 v1

摘要

词汇表大小是大型预训练语言模型中一个核心的设计选择,关系到性能和内存需求。通常,会使用字节对编码(byte pair encoding)和 WordPiece 等子词分词算法。在这项工作中,我们研究了多语言静态与上下文嵌入空间中分词方案的兼容性,并提出了一种反映跨语言分词兼容性的度量方法。我们的目标是防止不兼容的分词,例如英语中的“wine”(词级)与法语中的“v i n”(字符级),这类分词使得难以学习到良好的多语言语义表示。我们表明,我们的兼容性度量允许系统设计师创建跨语言兼容的词汇表——这一需求迄今为止在多语言模型中一直被忽视。

关键词

引用

@article{arxiv.2109.05772,
  title  = {Wine is Not v i n. -- On the Compatibility of Tokenizations Across Languages},
  author = {Antonis Maronikolakis and Philipp Dufter and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2109.05772},
  year   = {2021}
}

备注

Accepted at EMNLP 2021 Findings