Aurora-M:面向多语言语言与代码的开源持续预训练
计算与语言
2024-12-30 v3 人工智能
机器学习
摘要
预训练语言模型是 AI 应用的 integral 组成部分,但其高昂的训练计算成本限制了可及性。诸如 Bloom 和 StarCoder 等项目旨在普及预训练模型的访问权限,以促进协作式社区开发。尽管做出了这些努力,此类模型仍面临诸多挑战,如有限的多语言能力、持续预训练期间灾难性遗忘的风险、从头训练模型的高昂成本,以及符合 AI 安全标准和监管框架的需求。本文提出了 Aurora-M,一个拥有 15B 参数的多语言开源模型,基于英语、芬兰语、印地语、日语、越南语和代码进行训练。Aurora-M 从 StarCoderPlus 持续预训练了 435B 额外 token,其总训练 token 数超过了 2T。它是首个在人工审查的安全指令上进行微调的开源多语言模型,从而使其发展不仅符合常规的红队测试考量,还符合拜登-哈里斯关于人工智能安全、可靠和可信的开发与使用的行政命令中所阐述的具体关切。我们在广泛的任务和语言上评估了 Aurora-M,展示了其抵御灾难性遗忘的鲁棒性以及在多语言环境中的卓越性能,尤其是在安全评估方面。我们在 https://huggingface.co/aurora-m 开源了 Aurora-M 及其变体,以鼓励负责任的大语言模型开源开发。
引用
@article{arxiv.2404.00399,
title = {Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code},
author = {Taishi Nakamura and Mayank Mishra and Simone Tedeschi and Yekun Chai and Jason T Stillerman and Felix Friedrich and Prateek Yadav and Tanmay Laud and Vu Minh Chien and Terry Yue Zhuo and Diganta Misra and Ben Bogin and Xuan-Son Vu and Marzena Karpinska and Arnav Varma Dantuluri and Wojciech Kusa and Tommaso Furlanello and Rio Yokota and Niklas Muennighoff and Suhas Pai and Tosin Adewumi and Veronika Laippala and Xiaozhe Yao and Adalberto Junior and Alpay Ariyak and Aleksandr Drozd and Jordan Clive and Kshitij Gupta and Liangyu Chen and Qi Sun and Ken Tsui and Noah Persaud and Nour Fahmy and Tianlong Chen and Mohit Bansal and Nicolo Monti and Tai Dang and Ziyang Luo and Tien-Tung Bui and Roberto Navigli and Virendra Mehta and Matthew Blumberg and Victor May and Huu Nguyen and Sampo Pyysalo},
journal= {arXiv preprint arXiv:2404.00399},
year = {2024}
}
备注
Preprint