平行分词器:为跨语言迁移重新思考词汇设计
计算与语言
2025-10-08 v1
摘要
分词定义了多语言语言模型的基础,通过决定词语如何被表示以及在不同语言之间的共享方式。然而,现有方法往往无法有效支持跨语言迁移,因为语义等价的词被分配不同的嵌入。例如,英文的“I eat rice”和豪萨语的“Ina cin shinkafa”通常被映射到不同的词汇索引,导致无法共享表征,限制了跨语言的泛化。我们引入平行分词器。该新框架在单语上训练分词器,然后通过双语词典或词到词翻译进行词汇 exhaustively 对齐,确保语义等价词保持一致的索引。这种对齐强制实现跨语言的共享语义空间,同时自然改善 fertility 的平衡。为评估其有效性,我们从头在十三个低资源语言上预训练一个 transformer 编码器,并在情感分析、仇恨言论检测、情感分类和句子嵌入相似性上进行评估。在所有任务中,使用平行分词器训练的模型在常规多语言基线上均表现更好,证明重新思考分词对推进多语言表征学习至关重要——尤其是在低资源环境中。
引用
@article{arxiv.2510.06128,
title = {Parallel Tokenizers: Rethinking Vocabulary Design for Cross-Lingual Transfer},
author = {Muhammad Dehan Al Kautsar and Fajri Koto},
journal= {arXiv preprint arXiv:2510.06128},
year = {2025}
}
备注
18 pages, 25 tables, 7 figures