中文

所有语言代价相同吗?商业语言模型时代的 Tokenization

计算与语言 2023-05-24 v1

摘要

语言模型已从研究原型发展为作为网络 API 提供的商业化产品,近期工作凸显了这些产品的多语言能力。API 供应商基于使用量向用户收费,更具体地说是基于底层语言模型处理或生成的“token”数量。然而,一个 token 的构成依赖于训练数据和模型,且在不同语言中传达相同信息所需的 token 数量差异很大。在这项工作中,我们分析了这种非均匀性对 API 跨语言定价政策公平性的影响。我们对 OpenAI 语言模型 API 在 22 种类型学多样语言的多语言基准上的成本与效用进行了系统分析。我们提供的证据表明,大量受支持语言的用户被过度收费,同时获得较差的结果。这些用户往往也来自 API 原本就较难以负担的地区。通过这些分析,我们旨在提高围绕语言模型 API 定价政策的透明度,并鼓励供应商使其更加公平。

关键词

引用

@article{arxiv.2305.13707,
  title  = {Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models},
  author = {Orevaoghene Ahia and Sachin Kumar and Hila Gonen and Jungo Kasai and David R. Mortensen and Noah A. Smith and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2305.13707},
  year   = {2023}
}