分词差异作为基础设施偏差:子词系统如何在 LLM 访问与效率方面制造不平等
计算与语言
2025-10-15 v1 人工智能
摘要
分词差异构成了实现人工智能跨语言群体公平获取的重大障碍。该研究对超过200种语言的分词效率进行大规模跨语言评估,以系统性地量化大语言模型(LLMs)中的计算不平等。我们采用标准化的实验框架,对所有语言样本应用一致的预处理和归一化协议,随后通过tiktoken库进行统一分词。收集了包括Tokens Per Sentence (TPS)和Relative Tokenization Cost (RTC)在内的全面分词统计数据,基准测试于英语基准。我们的跨语言分析揭示了 substantial 且系统性的差异:拉丁文字语言始终表现出更高的分词效率,而非拉丁文字和形态复杂语言的分词膨胀显著更大,往往为RTC比率的3-5倍。这些效率差异导致不平等的计算成本和较低的有效上下文利用率。总体而言,研究结果凸显了当前AI系统中的结构性不平等,低资源和非拉丁文字语言的使用者面临比例性的计算劣势。未来的研究应致力于开发基于语言学信息的分词策略和自适应词汇构建方法,纳入语言类型多样性,以确保更具包容性和计算公平性的多语言AI系统。
引用
@article{arxiv.2510.12389,
title = {Tokenization Disparities as Infrastructure Bias: How Subword Systems Create Inequities in LLM Access and Efficiency},
author = {Hailay Kidu Teklehaymanot and Wolfgang Nejdl},
journal= {arXiv preprint arXiv:2510.12389},
year = {2025}
}
备注
6 pages 4 figures