基于 GPT-4o 的迭代代码质量评估与提升
软件工程
2025-02-12 v1 人工智能
摘要
本文引入 CodeQUEST 框架,利用大型语言模型(LLM)对代码质量进行多维度的迭代评估与提升,包括可读性、可维护性、效率和安全性等。框架包含两个主要组件:评估器对代码在十个维度上进行评估,给出定量分数和定性摘要;优化器根据评估器反馈迭代改进代码。我们的实验表明,CodeQUEST 能有效且稳健地评估代码质量,其评估结果与既定的代码质量指标高度一致。通过使用精选的 Python 和 JavaScript 示例数据集进行一系列实验,CodeQUEST 实现了代码质量的显著提升,平均相对提升率达 52.6%。该框架的评估结果与 Pylint 评分、Radon 可维护性指数和 Bandit 输出日志等代理指标之间的相关性表明其具有实际意义。这凸显了大型语言模型在自动化代码质量评估与改进过程中的潜力,为提升软件开发实践提供了重要进展。该框架的实现代码已公开于:https://github.com/jpmorganchase/CodeQuest。
引用
@article{arxiv.2502.07399,
title = {On Iterative Evaluation and Enhancement of Code Quality Using GPT-4o},
author = {Rundong Liu and Andre Frade and Amal Vaidya and Maxime Labonne and Marcus Kaiser and Bismayan Chakrabarti and Jonathan Budd and Sean Moran},
journal= {arXiv preprint arXiv:2502.07399},
year = {2025}
}