中文

XTREME-UP:面向低资源语言、以用户为中心的小数据基准

计算与语言 2024-01-30 v2

摘要

数据稀缺是高度多语言 NLP 系统开发中的关键问题。然而对于许多低资源语言(ULs)——即 NLP 研究在满足用户需求方面尤为滞后的语言——标注少量数据是可行的。受此驱动,我们提出 XTREME-UP,一个由以下定义界定的基准:聚焦于小数据场景而非零样本;聚焦于以用户为中心的任务——即被高资源语言使用者广泛采用的任务;以及聚焦于低资源语言,因为小数据场景在此最为现实。XTREME-UP 在 88 种低资源语言上评估语言模型跨越 9 项关键用户中心技术的能力,包括 ASR、OCR、MT 以及具有普遍效用的信息获取任务。我们为 OCR、自动补全、语义解析和音译创建了新的数据集,并基于和完善现有其他任务数据集。XTREME-UP 提供了评估多种建模范式的方法论,包括纯文本、多模态(视觉、音频与文本)、有监督参数微调以及上下文学习。我们在该基准上评估了常用模型。我们发布了所有用于训练和评估模型的代码与脚本。

关键词

引用

@article{arxiv.2305.11938,
  title  = {XTREME-UP: A User-Centric Scarce-Data Benchmark for Under-Represented Languages},
  author = {Sebastian Ruder and Jonathan H. Clark and Alexander Gutkin and Mihir Kale and Min Ma and Massimo Nicosia and Shruti Rijhwani and Parker Riley and Jean-Michel A. Sarr and Xinyi Wang and John Wieting and Nitish Gupta and Anna Katanova and Christo Kirov and Dana L. Dickinson and Brian Roark and Bidisha Samanta and Connie Tao and David I. Adelani and Vera Axelrod and Isaac Caswell and Colin Cherry and Dan Garrette and Reeve Ingle and Melvin Johnson and Dmitry Panteleev and Partha Talukdar},
  journal= {arXiv preprint arXiv:2305.11938},
  year   = {2024}
}