中文

人类仍优于 ChatGPT:以 IEEEXtreme 竞赛为例

软件工程 2023-05-12 v1 人工智能 计算与语言 计算机与社会 机器学习 编程语言

摘要

自 ChatGPT 发布以来,大量研究强调了其卓越性能,其在各类任务和领域中常可与人类能力媲美甚至超越。然而,本文通过展示一个人类表现优于适合 ChatGPT 的典型任务实例,提供了相反视角,具体在计算机编程领域。我们利用 IEEExtreme 挑战赛作为基准,这是一项享有盛誉的年度国际编程竞赛,涵盖具有不同复杂度的广泛问题。为进行彻底评估,我们选取并使用了三种主要编程语言(Python、Java 和 C++)执行了来自五个不同 IEEExtreme 版本的 102 道多样化挑战。我们的实证分析提供的证据表明,与流行看法相反,人类程序员在编程语境下问题解决的某些方面保持对 ChatGPT 的竞争优势。事实上,我们发现 ChatGPT 在 IEEExtreme 编程问题集上的平均得分比人类平均得分低 3.9 至 5.8 倍,具体取决于编程语言。本文详述了这些发现,为 ChatGPT 等基于 AI 的语言模型的局限性和潜在改进方向提供了批判性见解。

关键词

引用

@article{arxiv.2305.06934,
  title  = {Humans are Still Better than ChatGPT: Case of the IEEEXtreme Competition},
  author = {Anis Koubaa and Basit Qureshi and Adel Ammar and Zahid Khan and Wadii Boulila and Lahouari Ghouti},
  journal= {arXiv preprint arXiv:2305.06934},
  year   = {2023}
}

备注

9 pages, 3 figures