中文

Salamandra 技术报告

计算与语言 2025-02-14 v2

摘要

本工作介绍了 Salamandra,这是一个由开源解码器-only 大型语言模型组成的套件,包含三个不同规模的模型:20 亿、70 亿和400亿参数。该模型基于包含35种欧洲语言和代码的高度多语言数据的开放数据训练而成。我们精心筛选的语料库完全来自开放获取的数据,来源广泛。除了基座模型外,我们还发布了针对聊天应用进行公有领域指令数据微调的补充检查点。此外,我们还分享了关于多模态的初步实验,这些实验作为 Salamandra 系列潜在应用的概念验证。我们的广泛评估显示,Salamandra 在多语言基准测试中表现出强大的能力,与规模相似的开源模型性能具竞争力。我们提供了在标准下游任务以及偏见和安全性关键方面相关的全面评估结果。通过本技术报告,我们旨在通过分享我们设计选择、数据策展策略和评估方法的所有细节来促进开放科学。除了这一点,我们还偏离了通常的做法,使我们的训练和评估脚本公开可访问。我们以宽松的 Apache 2.0 许可证发布所有模型,以促进未来研究并便于商业使用,为大型语言模型的开源生态系统做出贡献。

关键词

引用

@article{arxiv.2502.08489,
  title  = {Salamandra Technical Report},
  author = {Aitor Gonzalez-Agirre and Marc Pàmies and Joan Llop and Irene Baucells and Severino Da Dalt and Daniel Tamayo and José Javier Saiz and Ferran Espuña and Jaume Prats and Javier Aula-Blasco and Mario Mina and Iñigo Pikabea and Adrián Rubio and Alexander Shvets and Anna Sallés and Iñaki Lacunza and Jorge Palomar and Júlia Falcão and Lucía Tormo and Luis Vasquez-Reina and Montserrat Marimon and Oriol Pareras and Valle Ruiz-Fernández and Marta Villegas},
  journal= {arXiv preprint arXiv:2502.08489},
  year   = {2025}
}