中文

Falcon2-11B 技术报告

计算与语言 2024-07-23 v1 计算机视觉与模式识别

摘要

我们介绍 Falcon2-11B,这是一个在超过五万亿个标记上训练的基础模型,以及其多模态对应模型 Falcon2-11B-vlm,这是一个从视觉到文本的模型。我们报告了在训练 Falcon2-11B 期间的研究发现,该模型遵循多阶段方法,其中早期阶段由其上下文长度区分,最终阶段使用精选的高质量数据集。此外,我们报告了在训练中翻倍 batch size 的效果,以及学习率如何影响训练损失峰值。对基础模型的下游性能在包括多语言和代码数据集在内的已建立基准上进行评估。该基础模型在所有任务上都表现出强大的泛化能力,使其适用于下游微调用例。对于视觉语言模型,我们报告了在几个基准上的表现,显示我们的模型在与之类似大小的开源模型中获得了更高的平均得分。Falcon2-11B 和 Falcon2-11B-vlm 的模型权重和代码均在宽松许可证下提供。

关键词

引用

@article{arxiv.2407.14885,
  title  = {Falcon2-11B Technical Report},
  author = {Quentin Malartic and Nilabhra Roy Chowdhury and Ruxandra Cojocaru and Mugariya Farooq and Giulia Campesan and Yasser Abdelaziz Dahou Djilali and Sanath Narayan and Ankit Singh and Maksim Velikanov and Basma El Amel Boussaha and Mohammed Al-Yafeai and Hamza Alobeidli and Leen Al Qadi and Mohamed El Amine Seddik and Kirill Fedyanin and Reda Alami and Hakim Hacid},
  journal= {arXiv preprint arXiv:2407.14885},
  year   = {2024}
}