中文

MAGNET:基于自适应梯度分词提升多语言模型公平性

计算与语言 2024-11-19 v2

摘要

在多语言场景中,非拉丁脚本和低资源语言在语言模型的实用性、效率和成本方面往往受到劣势。具体而言,先前研究报告了当前分词算法对非拉丁脚本语言引入的多种建模偏见,其中主要问题是过度分段。在本工作中,我们提出 MAGNET;多语言自适应梯度分词以通过自适应梯度子词分词减少过度分段。MAGNET 通过模型内部的子模块学习序列中字节 token 之间段落边界的预测,这些子模块充当内部边界预测器(分词器)。先前的梯度分词方法旨在通过集成训练期间的单个边界预测器并通过随机重参数化端到端优化来实现序列上的统一压缩,同时优化下一个 token 预测目标。然而,这种方法在多语言设置下仍然导致非拉丁脚本语言的过度分段。相比之下,MAGNET 提供可定制的架构,字节级序列通过针对各自语言脚本的预测器进行路由,每个预测器均针对其特定语言脚本进行优化。这种模块化设计在不同语言脚本之间强制实现均等的分段粒度,与先前方法相比。通过大量实验,我们展示除了减少分段差异外,MAGNET 还能实现更快的语言建模并提高下游实用性。

关键词

引用

@article{arxiv.2407.08818,
  title  = {MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization},
  author = {Orevaoghene Ahia and Sachin Kumar and Hila Gonen and Valentin Hofmann and Tomasz Limisiewicz and Yulia Tsvetkov and Noah A. Smith},
  journal= {arXiv preprint arXiv:2407.08818},
  year   = {2024}
}