中文

Safurai 001:一种用于代码 LLM 评估的新定性方法

计算与语言 2023-09-21 v1

摘要

本文提出 Safurai-001,一种在代码辅助领域具有显著潜力的大型语言模型(LLM)。受近期代码 LLM 进展的推动,Safurai-001 在性能上与 WizardCoder [Xu et al., 2023]、PanguCoder [Shen et al., 2023] 和 Phi-1 [Gunasekar et al., 2023] 等最新模型竞争,但旨在提供更对话式的交互。通过利用数据工程(包括最新的数据转换与提示工程技术)和指令微调方面的进展,这一新模型有望与近期闭源和开源成果相抗衡。认识到亟需一种针对代码 LLM 的有效评估指标,本文还引入了基于 GPT4 的多参数(GPT4-based MultiParameters)评估基准,该基准利用多种参数全面揭示模型的功能与性能。我们的评估表明,Safurai-001 在代码可读性参数上可分别超越 GPT-3.5 达 1.58%、超越 WizardCoder 达 18.78% 等。

关键词

引用

@article{arxiv.2309.11385,
  title  = {Safurai 001: New Qualitative Approach for Code LLM Evaluation},
  author = {Davide Cifarelli and Leonardo Boiardi and Alessandro Puppo},
  journal= {arXiv preprint arXiv:2309.11385},
  year   = {2023}
}

备注

22 pages, 1 figure, 3 tables