评估大型语言模型在印度官方语言上的分词器性能
计算与语言
2024-11-27 v2 人工智能
摘要
基于Transformer架构的大型语言模型(LLMs)已经彻底改变了多个领域,其中分词在其预处理和微调阶段起着关键作用。在多语言模型中,特别是那些为印度语言定制的模型,有效的分词对于优化性能至关重要。本文对12个LLM使用的分词器在印度所有22种官方语言上进行了全面评估,重点是比较其分词过程的效率。我们在分析中采用归一化序列长度(NSL)作为关键指标。我们的发现表明,SUTRA分词器在所有其他模型中表现最佳,包括几个特定于印度的模型,在14种语言中表现出色。值得注意的见解包括:SUTRA分词器在处理印度语言方面的优越性,GPT-4o在其前身GPT-4处理印度语言方面的进步,以及Project Indus在某些语言中的有限性能。这项研究强调了为多语言和以印度为中心模型开发针对性分词策略的关键重要性,为未来改进分词器设计以增强语言覆盖率和模型效率奠定了基础。
引用
@article{arxiv.2411.12240,
title = {Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages},
author = {S. Tamang and D. J. Bora},
journal= {arXiv preprint arXiv:2411.12240},
year = {2024}
}