BigScience:多语言大语言模型社会建构的个案研究
计算机与社会
2022-12-12 v1
摘要
BigScience 研讨会是一项价值驱动的倡议,跨越一年半的跨学科研究,最终创建了 ROOTS——一个 1.6TB 的多语言数据集,用于训练 BLOOM,迄今最大的多语言语言模型之一。除技术成果与制品外,该研讨会围绕大模型、数据集及其分析促进了多学科协作。这进而产生了一系列涵盖从伦理到法律、数据治理、建模选择及分布式训练等主题的广泛研究出版物。本文聚焦 BigScience 的协作研究方面,并退一步审视大规模参与式研究在参与者多样性与成功执行此类项目所需任务方面的挑战。我们的主要目标是分享从这一经验中获得的教训、我们本可做得更好的地方以及我们做得好的地方。我们展示了这种科学研究的社会化路径的影响远远超出作为其开端基础的技术制品。
引用
@article{arxiv.2212.04960,
title = {BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model},
author = {Christopher Akiki and Giada Pistilli and Margot Mieskes and Matthias Gallé and Thomas Wolf and Suzana Ilić and Yacine Jernite},
journal= {arXiv preprint arXiv:2212.04960},
year = {2022}
}
备注
Presented at the 2022 NeurIPS Workshop on Broadening Research Collaborations in ML