中文

Pixtral 12B

计算机视觉与模式识别 2024-10-14 v2 计算与语言

摘要

我们介绍Pixtral-12B,这是一个拥有120亿参数的多模态语言模型。Pixtral-12B被训练以理解自然图像和文档,实现了在各种多模态基准测试上的领先性能,超越了许多更大的模型。与许多开源模型不同,Pixtral也是其规模的 cutting-edge文本模型,不会为在多模态任务中脱颖而出而妥协于自然语言性能。Pixtral使用一种从头训练的新型视觉编码器,使其能够以其自然的分辨率和宽高比比例处理图像。这为用户提供了灵活的用于处理图像的标记数。Pixtral还能够处理其128K标记的长上下文窗口中的任意数量的图像。Pixtral 12B在规模相似的其他开源模型(Llama-3.2 11B 与 Qwen-2-VL 7B)方面显著优于后者;而且在更大的开源模型(如Llama-3.2 90B)方面也表现更好,却仅小7倍。我们进一步贡献了一个开源基准,MM-MT-Bench,用于在实际场景中评估视觉语言模型,并提供详细分析和代码以进行标准化的多模态LLM评估。Pixtral-12B在Apache 2.0许可证下发布。

关键词

引用

@article{arxiv.2410.07073,
  title  = {Pixtral 12B},
  author = {Pravesh Agrawal and Szymon Antoniak and Emma Bou Hanna and Baptiste Bout and Devendra Chaplot and Jessica Chudnovsky and Diogo Costa and Baudouin De Monicault and Saurabh Garg and Theophile Gervet and Soham Ghosh and Amélie Héliou and Paul Jacob and Albert Q. Jiang and Kartik Khandelwal and Timothée Lacroix and Guillaume Lample and Diego Las Casas and Thibaut Lavril and Teven Le Scao and Andy Lo and William Marshall and Louis Martin and Arthur Mensch and Pavankumar Muddireddy and Valera Nemychnikova and Marie Pellat and Patrick Von Platen and Nikhil Raghuraman and Baptiste Rozière and Alexandre Sablayrolles and Lucile Saulnier and Romain Sauvestre and Wendy Shang and Roman Soletskyi and Lawrence Stewart and Pierre Stock and Joachim Studnia and Sandeep Subramanian and Sagar Vaze and Thomas Wang and Sophia Yang},
  journal= {arXiv preprint arXiv:2410.07073},
  year   = {2024}
}