中文

评估代码生成中的大型语言模型:定义推理指数的 INFINITE 方法论

软件工程 2025-04-10 v1 人工智能

摘要

本研究引入了一种新的推理指数方法论,称为测试模型有效性推理指数方法论(INFINITE),旨在评估大型语言模型在代码生成任务中的性能。推理指数提供了一项综合性评估,重点关注三个关键组成部分:效率、一致性和准确性。该方法涵盖了基于时间的效率、响应质量和模型输出的稳定性,提供了超越传统准确性指标的对 LLM 性能的全面理解。我们将该方法论应用于比较 OpenAI 的 GPT-4o (GPT)、OpenAI-o1 pro (OAI1) 和 OpenAI-o3 mini-high (OAI3) 在生成用于预测温度、相对湿度和风速等气象变量的长短期记忆(LSTM)模型 Python 代码时的表现。我们的研究结果表明,GPT 优于 OAI1,且在准确性和工作流效率方面与 OAI3 表现相当。该研究表明,通过有效的提示和优化,LLM 辅助代码生成可以产生与专家设计的模型相似的结果。GPT 的性能优势凸显了广泛使用和用户反馈的益处。

关键词

引用

@article{arxiv.2503.05852,
  title  = {Evaluating Large Language Models in Code Generation: INFINITE Methodology for Defining the Inference Index},
  author = {Nicholas Christakis and Dimitris Drikakis},
  journal= {arXiv preprint arXiv:2503.05852},
  year   = {2025}
}

备注

20 pages, 6 figures