中文

一个小问题:跨语言数据集规模的测量差异

计算与语言 2024-03-04 v1

摘要

应如何比较不同语言的文本数据集规模?即使是内容匹配(平行)的语料库,UTF-8 编码的文本在不同语言中也可能需要截然不同的字节数。在我们的工作中,我们将两种语言之间的字节溢价定义为编码这两种语言中内容匹配文本所用字节的比率。我们计算了 1155 种语言的字节溢价,并利用线性回归估算其他语言的字节溢价。我们发布了一款工具以获取任意两种语言之间的字节溢价,从而能够跨语言比较数据集规模,促进更公平的多语言模型开发和数据实践。

关键词

引用

@article{arxiv.2403.00686,
  title  = {A Bit of a Problem: Measurement Disparities in Dataset Sizes Across Languages},
  author = {Catherine Arnett and Tyler A. Chang and Benjamin K. Bergen},
  journal= {arXiv preprint arXiv:2403.00686},
  year   = {2024}
}