梵语是最具词元效率的语言吗?基于GPT、Gemini和SentencePiece的定量研究
计算与语言
2026-01-13 v1 人工智能
机器学习
摘要
词元是大语言模型(LLM)的基本单位。LLM依赖分词器将文本分割成这些词元,而分词是计算和推理成本的主要决定因素。梵语作为一种最古老的语言,由于其形态和语法规则,被假设每个词元能表达更多含义;然而,此前尚无研究对此进行量化。我们使用了一个包含701节《薄伽梵歌》平行诗句的数据集,涵盖三种语言——梵语、英语和印地语,以及梵语的拉丁转写。我们测试了包括SentencePiece(SPM)、较旧的GPT模型以及来自Gemini和GPT的最新一代分词器在内的多种分词器。我们使用了词元数量、每词元字符数(词元效率)和每字符词元数(词元成本)等指标。结果显示,在无偏的SPM基线条件下,梵语与英语/印地语之间的词元数量存在约2倍的差异。梵语注释的英语/印地语翻译导致词元数量增加了约20倍。GPT o200k base(最新版,被GPT-4o使用)和Gemini(最新版)相比GPT cl100k base(GPT-4之前使用的版本)显著降低了偏差,但仍未能完全捕捉梵语的紧凑性。这一点很重要,因为可能存在对非英语用户的惩罚性偏差,这会增加词元数量。本研究为改进未来分词器设计奠定了基础,并展示了梵语在高度紧凑编码方面的潜力,从而在加速训练和推理的同时节省成本。代码和数据集可在https://github.com/anshulkr713/sanskrit-token-efficiency获取。
引用
@article{arxiv.2601.06142,
title = {Is Sanskrit the most token-efficient language? A quantitative study using GPT, Gemini, and SentencePiece},
author = {Anshul Kumar},
journal= {arXiv preprint arXiv:2601.06142},
year = {2026}
}
备注
9 pages, 4 figures. Code and dataset available at: https://github.com/anshulkr713/sanskrit-token-efficiency