评估 ChatGPT 用于自动化代码生成的潜力与缺陷
软件工程
2023-11-07 v1 人工智能
摘要
本文对著名大语言模型 (LLM) ChatGPT 与人类程序员相比的代码生成能力进行了全面评估。我们策划了一个包含 5 类共 131 个代码生成提示的新数据集以实现稳健分析。针对所有提示,由 ChatGPT 与人类分别生成代码解,得到 262 个代码样本。一种细致的手动评估方法优先使用 14 项既有代码质量度量来评估正确性、可理解性与安全性。关键发现揭示了 ChatGPT 在编写简洁、高效且带高级构造的代码方面的优势,在数据分任务中展现优势(93.1% 准确率),但在视觉图形挑战中存在局限。与人工代码的比较分析凸显了 ChatGPT 对模块化设计与优越错误处理的倾向。此外,机器学习模型以高达 88% 的准确率有效区分 ChatGPT 与人工代码,表明存在可检测的编码风格差异。通过定量度量与定性分析对 ChatGPT 的代码生成能力与局限提供深刻见解,本研究为推进基于 AI 的编程助手作出了宝贵贡献。所策划的数据集与方法为该新兴领域的未来研究提供了稳健基础。所有数据与代码见 https://github.com/DSAatUSU/ChatGPT-promises-and-pitfalls。
引用
@article{arxiv.2311.02640,
title = {Assessing the Promise and Pitfalls of ChatGPT for Automated Code Generation},
author = {Muhammad Fawad Akbar Khan and Max Ramsdell and Erik Falor and Hamid Karimi},
journal= {arXiv preprint arXiv:2311.02640},
year = {2023}
}