代码生成任务中大型语言模型评估综述
广义相对论与量子宇宙学
2025-07-02 v2 高能天体物理现象
太阳与恒星天体物理
摘要
本文提供了关于大型语言模型(LLM)在代码生成任务中所用当前方法和指标的全面综述。随着自动化软件开发需求的快速增长,LLM在代码生成领域展现出显著潜力。论文首先回顾了LLM的历史发展及其在代码生成中的应用。接着,详细阐述了各种方法和指标来评估LLM的代码生成能力,包括代码正确性、效率、可读性以及基于专家评论和用户体验的评估方法。论文还评估了广泛使用的基准数据集,识别其局限性并提出未来改进方向。具体而言,论文通过结合多种评估指标,对不同任务中的代码生成模型进行性能分析,包括代码编译/解释成功率、单元测试通过率以及性能和效率指标,以全面评估LLM在代码生成中的实际应用。最后,论文讨论了在代码生成中评估LLM所面临的挑战,特别是如何确保评估方法的全面性和准确性,以及如何适应软件开发不断演变的实践。这些分析和讨论为进一步优化和改进LLM在代码生成任务中的应用提供了宝贵见解。
引用
@article{arxiv.2408.16497,
title = {Application of Kaluza-Klein Theory in Modeling Compact Stars: Exploring Extra Dimensions},
author = {Anna Horváth and Emese Forgács-Dajka and Gergely Gábor Barnaföldi},
journal= {arXiv preprint arXiv:2408.16497},
year = {2025}
}
备注
11 pages, 8 figures