中文

MojoBench: Mojo语言的语言模型与基准测试

计算与语言 2024-10-24 v1

摘要

Modular公司最近推出的Mojo编程语言,因其声称比Python有显著的加速效果而受到科学界的广泛关注。尽管代码大语言模型(LLMs)在各种编程语言上取得了进展,但Mojo在此背景下仍未得到探索。为填补这一空白,我们引入了MojoBench,这是首个用于Mojo代码生成的框架。MojoBench包括HumanEval-Mojo,一个专为评估Mojo代码LLMs而设计的基准数据集,以及Mojo-Coder,首个针对Mojo代码生成进行预训练和微调的LLM,它支持5种自然语言的指令。我们的结果表明,Mojo-Coder相较于GPT-4o和Claude-3.5-Sonnet等领先模型实现了30-35%的性能提升。此外,我们还提供了关于LLM在代表性不足和未见过的编程语言上行为的见解,并提出了增强模型适应性的潜在策略。MojoBench有助于我们理解LLM在新兴编程范式中的能力和局限性,从而促进更鲁棒的代码生成系统的发展。

关键词

引用

@article{arxiv.2410.17736,
  title  = {MojoBench: Language Modeling and Benchmarks for Mojo},
  author = {Nishat Raihan and Joanna C. S. Santos and Marcos Zampieri},
  journal= {arXiv preprint arXiv:2410.17736},
  year   = {2024}
}