语言模型中的平等语言表征:一切始于分词器
计算与语言
2025-01-22 v1 人工智能
摘要
分词器充当了人类语言与语言模型潜在空间之间的桥梁,影响着语言在这些模型中的表征方式。由于以英语为中心的大型语言模型(LLMs)的广泛流行,人们正努力将其适配到其他语言。然而,我们从分词的角度证明,并非所有分词器都能为泰米尔语、僧伽罗语和印地语等复杂文字语言提供公平的表征,这主要归因于预分词方法的选择。我们进一步表明,在实现这些复杂文字语言的平等表征方面,预分词比分词算法本身起着更关键的作用。为解决此问题,我们通过引入字素对字节对编码(BPE)算法进行了改进,并将其命名为字素对编码(GPE)。我们的实验表明,对于复杂文字,基于字素的字符提取优于字节级分词器。我们通过在泰米尔语、僧伽罗语和印地语上的实验验证了该方法。
引用
@article{arxiv.2409.11501,
title = {Egalitarian Language Representation in Language Models: It All Begins with Tokenizers},
author = {Menan Velayuthan and Kengatharaiyer Sarveswaran},
journal= {arXiv preprint arXiv:2409.11501},
year = {2025}
}
备注
Content - 8 pages, References - 3 pages