Safurai 001:一种用于代码 LLM 评估的新定性方法
计算与语言
2023-09-21 v1
摘要
本文提出 Safurai-001,一种在代码辅助领域具有显著潜力的大型语言模型(LLM)。受近期代码 LLM 进展的推动,Safurai-001 在性能上与 WizardCoder [Xu et al., 2023]、PanguCoder [Shen et al., 2023] 和 Phi-1 [Gunasekar et al., 2023] 等最新模型竞争,但旨在提供更对话式的交互。通过利用数据工程(包括最新的数据转换与提示工程技术)和指令微调方面的进展,这一新模型有望与近期闭源和开源成果相抗衡。认识到亟需一种针对代码 LLM 的有效评估指标,本文还引入了基于 GPT4 的多参数(GPT4-based MultiParameters)评估基准,该基准利用多种参数全面揭示模型的功能与性能。我们的评估表明,Safurai-001 在代码可读性参数上可分别超越 GPT-3.5 达 1.58%、超越 WizardCoder 达 18.78% 等。
引用
@article{arxiv.2309.11385,
title = {Safurai 001: New Qualitative Approach for Code LLM Evaluation},
author = {Davide Cifarelli and Leonardo Boiardi and Alessandro Puppo},
journal= {arXiv preprint arXiv:2309.11385},
year = {2023}
}
备注
22 pages, 1 figure, 3 tables