Aya Dataset:用于多语言指令微调的开放访问集合
计算与语言
2024-02-12 v1 人工智能
摘要
数据集是现代人工智能许多突破的基础。自然语言处理 (NLP) 领域的许多近期成就可归因于在多样化任务集上对预训练模型进行微调,从而使大语言模型 (LLM) 能够响应指令。指令微调 (IFT) 需要专门构建和标注的数据集。然而,现有数据集几乎全为英语。在本工作中,我们的主要目标是通过构建一个跨越 65 种语言的人工策划指令跟随数据集来弥合语言差距。我们与来自世界各地的流利母语者合作,收集了自然的指令和完成实例。此外,我们创建了迄今为止最广泛的多语言集合,通过对现有数据集进行模板化和翻译,涵盖了 114 种语言的 5.13 亿个实例。总之,我们贡献了四项关键资源:开发并开源了 Aya 标注平台、Aya 数据集、Aya 集合以及 Aya 评估套件。Aya 倡议也作为参与式研究的一个宝贵案例研究,涉及来自 119 个国家的合作者。我们将此视为未来旨在弥合资源差距的研究合作的宝贵框架。
引用
@article{arxiv.2402.06619,
title = {Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning},
author = {Shivalika Singh and Freddie Vargus and Daniel Dsouza and Börje F. Karlsson and Abinaya Mahendiran and Wei-Yin Ko and Herumb Shandilya and Jay Patel and Deividas Mataciunas and Laura OMahony and Mike Zhang and Ramith Hettiarachchi and Joseph Wilson and Marina Machado and Luisa Souza Moura and Dominik Krzemiński and Hakimeh Fadaei and Irem Ergün and Ifeoma Okoh and Aisha Alaagib and Oshan Mudannayake and Zaid Alyafeai and Vu Minh Chien and Sebastian Ruder and Surya Guthikonda and Emad A. Alghamdi and Sebastian Gehrmann and Niklas Muennighoff and Max Bartolo and Julia Kreutzer and Ahmet Üstün and Marzieh Fadaee and Sara Hooker},
journal= {arXiv preprint arXiv:2402.06619},
year = {2024}
}