中文

揭开巨人的面纱:ChatGPT 在编码算法与数据结构方面能力的综合评估

软件工程 2024-05-28 v3 人工智能 计算与语言

摘要

大型语言模型(LLMs)的变革性影响正深刻重塑人工智能(AI)技术领域。值得注意的是,ChatGPT 在这些模型中表现突出,在多轮对话中展现出卓越性能,并在多种语言上表现出代码能力。在本文中,我们基于迄今最大的编码挑战目录对 ChatGPT 的编码能力进行了综合评估。我们聚焦于 Python 编程语言以及以数据结构和算法为中心的问题,这两个主题处于计算机科学的基础。我们评估 ChatGPT 生成正确解题代码的能力、其代码质量,以及其代码抛出的运行时错误性质。在 ChatGPT 代码成功执行但未能解决问题时,我们考察所通过测试用例中的模式,以洞察此类情况下 ChatGPT 代码的错误程度。为推断 ChatGPT 是否可能直接记忆了部分用于训练的数据,我们系统性地设计实验以研究该现象。在可行时与人类表现进行比较,我们从其底层学习模型(GPT-3.5 和 GPT-4)的语境下、在主要主题内的广阔子主题上、以及在不同难度的问题上考察了上述所有问题。

关键词

引用

@article{arxiv.2307.05360,
  title  = {Unmasking the giant: A comprehensive evaluation of ChatGPT's proficiency in coding algorithms and data structures},
  author = {Sayed Erfan Arefin and Tasnia Ashrafi Heya and Hasan Al-Qudah and Ynes Ineza and Abdul Serwadda},
  journal= {arXiv preprint arXiv:2307.05360},
  year   = {2024}
}

备注

Accepted at the 16th International Conference on Agents and Artificial Intelligence (ICAART) 2024. DOI: 10.5220/0012467100003636