语言模型分词器在语言间引入不公平性
计算与语言
2023-10-23 v2 机器学习
摘要
近期的语言模型已展现出令人印象深刻的多语言性能,即便并未经过明确的多语言训练。尽管如此,人们仍担忧其跨语言输出的质量。在本文中,我们展示了不同语言所受差异待遇如何在调用模型之前的词元化(tokenization)阶段就已产生。同一文本被翻译成不同语言后,其词元化长度可能存在天壤之别,某些情况下差异高达 15 倍。即便对于专门训练用于多语言支持的分词器,这种差异依然存在。字符级和字节级模型在某些语言对上的编码长度差异也超过 4 倍。这导致部分语言群体在访问商业语言服务的成本、处理时间与延迟,以及可作为上下文提供给模型的内容量方面遭受不公平待遇。因此,我们主张未来应使用多语言公平的次词(subword)分词器来训练语言模型。
引用
@article{arxiv.2305.15425,
title = {Language Model Tokenizers Introduce Unfairness Between Languages},
author = {Aleksandar Petrov and Emanuele La Malfa and Philip H. S. Torr and Adel Bibi},
journal= {arXiv preprint arXiv:2305.15425},
year = {2023}
}
备注
Published at NeurIPS 2023, Project webpage: https://aleksandarpetrov.github.io/tokenization-fairness, Code: https://github.com/AleksandarPetrov/tokenization-fairness