中文

基准测试 ChatGPT、Codeium 和 GitHub Copilot:AI 驱动编程与调试助手的比较研究

软件工程 2024-10-01 v1

摘要

随着 AI 驱动工具在软件开发中的广泛采用,大型语言模型 (LLM) 已成为代码生成、bug 修复和优化等任务的必备工具。ChatGPT、GitHub Copilot 和 Codeium 等工具在解决编程挑战方面提供了有价值的帮助,但其有效性仍未得到充分探索。本文对 ChatGPT、Codeium 和 GitHub Copilot 进行比较研究,通过 LeetCode 题目评估其在不同难度级别和类别中的性能。评估指标包括成功率、运行效率、内存使用情况和错误处理能力。GitHub Copilot 在简单和中等难度任务中表现优异,而 ChatGPT 在内存效率和调试方面表现更佳。Codeium 虽有前景,但在处理更复杂问题时表现不足。尽管各工具都有各自的优势,但在处理更难的问题时仍面临挑战。这些发现提供了对每种工具能力与局限性的深入理解,为开发人员和研究人员寻求优化 AI 集成到编码工作流程方面提供了指导。

关键词

引用

@article{arxiv.2409.19922,
  title  = {Benchmarking ChatGPT, Codeium, and GitHub Copilot: A Comparative Study of AI-Driven Programming and Debugging Assistants},
  author = {Md Sultanul Islam Ovi and Nafisa Anjum and Tasmina Haque Bithe and Md. Mahabubur Rahman and Mst. Shahnaj Akter Smrity},
  journal= {arXiv preprint arXiv:2409.19922},
  year   = {2024}
}