Aya 模型:一种指令微调的开源多语言语言模型
计算与语言
2024-02-13 v1
摘要
大型语言模型 (LLM) 近期的突破主要集中在少数数据丰富的语言上。要将这些突破扩展到非主流语言之外,需要什么条件?我们的工作推出了 Aya,这是一个大规模多语言生成式语言模型,能够遵循 101 种语言的指令,其中超过 50% 被视为低资源语言。Aya 在大多数任务上的表现优于 mT0 和 BLOOMZ,同时覆盖的语言数量是其两倍。我们引入了广泛的新评估套件,将 99 种语言的多语言评估水平提升至最先进状态——包括判别式和生成式任务、人工评估以及模拟胜率,涵盖留持任务和分布内性能。此外,我们对最优微调混合组成、数据剪枝以及模型的毒性、偏见和安全性进行了详细调查。我们在 https://hf.co/CohereForAI/aya-101 开源了指令数据集和我们的模型。
引用
@article{arxiv.2402.07827,
title = {Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model},
author = {Ahmet Üstün and Viraat Aryabumi and Zheng-Xin Yong and Wei-Yin Ko and Daniel D'souza and Gbemileke Onilude and Neel Bhandari and Shivalika Singh and Hui-Lee Ooi and Amr Kayid and Freddie Vargus and Phil Blunsom and Shayne Longpre and Niklas Muennighoff and Marzieh Fadaee and Julia Kreutzer and Sara Hooker},
journal= {arXiv preprint arXiv:2402.07827},
year = {2024}
}