Aya 23:开源权重以进一步多语言进展
计算与语言
2024-06-03 v2
摘要
本技术报告介绍Aya 23,一套多语言语言模型。Aya 23基于最近发布的Aya模型("Ust"un 等,2024)进行发展,侧重于将高性能预训练模型与刚刚发布的Aya collection(Singh 等,2024)进行配对。结果是一个强大的多语言大语言模型,服务于23种语言,将最先进的语言建模能力扩展到全球人口约半数的水平。Aya模型覆盖101种语言,而Aya 23是对深度与广度进行探索的实验,通过在预训练期间为更少的语言分配更多资源来探索其影响。Aya 23在所覆盖的语言方面超越了Aya 101等大规模多语言模型,也在广泛的判别和生成任务中超越了Gemma、Mistral和Mixtral等常用模型。我们作为持续承诺的一部分,发布8B和35B模型的开源权重,以扩大对多语言进展的可及性。
引用
@article{arxiv.2405.15032,
title = {Aya 23: Open Weight Releases to Further Multilingual Progress},
author = {Viraat Aryabumi and John Dang and Dwarak Talupuru and Saurabh Dash and David Cairuz and Hangyu Lin and Bharat Venkitesh and Madeline Smith and Jon Ander Campos and Yi Chern Tan and Kelly Marchisio and Max Bartolo and Sebastian Ruder and Acyr Locatelli and Julia Kreutzer and Nick Frosst and Aidan Gomez and Phil Blunsom and Marzieh Fadaee and Ahmet Üstün and Sara Hooker},
journal= {arXiv preprint arXiv:2405.15032},
year = {2024}
}