Teuken-7B-Base 与 Teuken-7B-Instruct:通向欧洲语言模型
计算与语言
2025-08-22 v3 人工智能
机器学习
摘要
我们介绍了两个多语言大语言模型,Teuken 7B-base 和 Teuken 7B-instruct,旨在通过支持欧洲联盟所有 24 种官方语言来迎接欧洲的语言多样性。模型在约 60% 非英文数据上进行训练,并利用自定义的多语言标记化器开发,旨在解决现有大语言模型主要关注英文或仅支持少数高资源语言的局限性。我们详细描述了模型的开发原则,即数据组成、标记化器优化和训练方法。这些模型在多语言基准测试中表现出色,尤其是在欧洲版本的 ARC、HellaSwag 和 TruthfulQA 上的表现。
引用
@article{arxiv.2410.03730,
title = {Teuken-7B-Base & Teuken-7B-Instruct: Towards European LLMs},
author = {Mehdi Ali and Michael Fromm and Klaudia Thellmann and Jan Ebert and Alexander Arno Weber and Richard Rutmann and Charvi Jain and Max Lübbering and Daniel Steinigen and Johannes Leveling and Katrin Klug and Jasper Schulze Buschhoff and Lena Jurkschat and Hammam Abdelwahab and Benny Jörg Stein and Karl-Heinz Sylla and Pavel Denisov and Nicolo' Brandizzi and Qasid Saleem and Anirban Bhowmick and Lennard Helmer and Chelsea John and Pedro Ortiz Suarez and Malte Ostendorff and Alex Jude and Lalith Manjunath and Samuel Weinbach and Carolin Penke and Oleg Filatov and Fabio Barth and Paramita Mirza and Lucas Weber and Ines Wendler and Rafet Sifa and Fabian Küch and Andreas Herten and René Jäkel and Georg Rehm and Stefan Kesselheim and Joachim Köhler and Nicolas Flores-Herr},
journal= {arXiv preprint arXiv:2410.03730},
year = {2025}
}