中文

Nemotron-4 15B 技术报告

计算与语言 2024-02-28 v2 人工智能 机器学习

摘要

我们介绍了 Nemotron-4 15B,这是一个拥有 150 亿参数的大型多语言语言模型,在 8 万亿文本 token 上进行训练。Nemotron-4 15B 在英语、多语言和编码任务评估中表现出强劲的性能:在 7 个下游评估领域中的 4 个领域,其表现优于所有现有同等规模的开源模型,并在其余领域达到了与领先开源模型相当的竞争力。具体而言,Nemotron-4 15B 展现了所有同等规模模型中最佳的多语言能力,甚至优于规模大四倍以上的模型以及那些专门针对多语言任务优化的模型。

关键词

引用

@article{arxiv.2402.16819,
  title  = {Nemotron-4 15B Technical Report},
  author = {Jupinder Parmar and Shrimai Prabhumoye and Joseph Jennings and Mostofa Patwary and Sandeep Subramanian and Dan Su and Chen Zhu and Deepak Narayanan and Aastha Jhunjhunwala and Ayush Dattagupta and Vibhu Jawa and Jiwei Liu and Ameya Mahabaleshwarkar and Osvald Nitski and Annika Brundyn and James Maki and Miguel Martinez and Jiaxuan You and John Kamalu and Patrick LeGresley and Denys Fridman and Jared Casper and Ashwath Aithal and Oleksii Kuchaiev and Mohammad Shoeybi and Jonathan Cohen and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2402.16819},
  year   = {2024}
}