FinGPT:面向小语种的大型生成模型
计算与语言
2023-11-13 v1
摘要
大型语言模型(LLMs)在NLP及更广泛领域的诸多任务中表现出色,但大多数开放模型对较小语种的覆盖极为有限,且LLM工作往往聚焦于几乎可获取无限预训练数据的语言。在本工作中,我们研究为芬兰语(全球人口中使用者占比不足0.1%的语言)创建LLM的挑战。我们编制了一个融合网络爬取、新闻、社交媒体和电子书的广泛芬兰语数据集。我们采用两种预训练模型方法:1)我们从头训练七个单语模型(1.86亿至130亿参数),称为FinGPT;2)我们在原始训练数据与芬兰语的混合语料上继续预训练多语BLOOM模型,得到名为BLUUMI的1760亿参数模型。在模型评估方面,我们引入了FIN-bench,即带有芬兰语任务的BIG-bench版本。我们还评估了毒性与偏见等其他模型特性。我们的模型与工具公开于 https://turkunlp.org/gpt3-finnish。
引用
@article{arxiv.2311.05640,
title = {FinGPT: Large Generative Models for a Small Language},
author = {Risto Luukkonen and Ville Komulainen and Jouni Luoma and Anni Eskelinen and Jenna Kanerva and Hanna-Mari Kupari and Filip Ginter and Veronika Laippala and Niklas Muennighoff and Aleksandra Piktus and Thomas Wang and Nouamane Tazi and Teven Le Scao and Thomas Wolf and Osma Suominen and Samuli Sairanen and Mikko Merioksa and Jyrki Heinonen and Aija Vahtola and Samuel Antao and Sampo Pyysalo},
journal= {arXiv preprint arXiv:2311.05640},
year = {2023}
}
备注
17 pages (10 main), 7 figures, 5 tables