中文

面向大型语言模型的 linguistics-aware and language-independent tokenization

计算与语言 2024-10-07 v1 机器学习

摘要

本文系统研究了当前主流大型语言模型(LLMs)所采用的分词技术及其对不同语言(尤其是低资源语言)服务成本与可获得性的影响。分析涉及GPT-4(使用cl100k_base嵌入)、GPT-3(p50k_base嵌入)、DaVinci(r50k_base嵌入)以及广泛使用的BERT base分词器。研究评估了这些模型之间分词的变异性,探讨了子词分词中语言学表征的挑战。本研究强调在语言传统上资源匮乏的地区,建立语言感知的开发实践的重要性。此外,本文提供案例研究,凸显分词选择在电子健康记录(EHR)系统中的实际影响。本研究旨在推动AI服务在本领域及更广泛领域的可国际化(I18N)实践,特别强调对传统计资源匮乏语言的包容性。

关键词

引用

@article{arxiv.2410.03568,
  title  = {Towards Linguistically-Aware and Language-Independent Tokenization for Large Language Models (LLMs)},
  author = {Abrar Rahman and Garry Bowlin and Binit Mohanty and Sean McGunigal},
  journal= {arXiv preprint arXiv:2410.03568},
  year   = {2024}
}