中文

Deep-Bench:面向代码生成的深度学习基准数据集

软件工程 2025-02-27 v1 人工智能 机器学习

摘要

深度学习(DL)在计算机视觉、自然语言处理等领域取得了巨大进展。然而,由于 DL 工作流程的复杂性,开发 DL 系统仍然具有挑战性。大型语言模型(LLM),如 GPT、Claude、Llama、Mistral 等,作为辅助生成 DL 代码的潜在工具,正在逐渐成为解决这些挑战的有力选择。尽管如此,现有基准如 DS-1000 仍存在局限,主要聚焦于与预/后处理任务相关的小型 DL 代码片段,缺乏对完整 DL 管道(包括不同 DL 阶段和输入数据类型)的全面覆盖。为此,我们提出 DeepBench,一个面向函数级 DL 代码生成的新型基准数据集。DeepBench 根据三个关键维度对 DL 问题进行分类:阶段(包括预处理、模型构建和训练)、任务(包括分类、回归和推荐)以及输入数据类型(包括表格、图像和文本)。在 DeepBench 上,GPT-4o——最先进的 LLM——的准确率为 31%,显著低于其在 DS-1000 上的 60%。我们还观察到其他 LLM(如 Claude、LLaMA、Mistral)在 DeepBench 上的表现类似:分别为 28% vs. 54%、21% vs. 41%、15% vs. 20%。这一结果凸显了 DeepBench 的更高复杂度。我们还构建了 LLM 生成 DL 代码中发现的问题和错误的分类,突显了 LLM 在生成 DL 代码方面与通用代码生成相比的独特挑战。此外,我们的分析也揭示了不同类别之间的显著性能差异,阶段差异可达 7%,任务差异可达 37%。这些差异表明,DeepBench 为理解 LLM 在 DL 领域的性能及其改进方向提供了宝贵见解。

关键词

引用

@article{arxiv.2502.18726,
  title  = {Deep-Bench: Deep Learning Benchmark Dataset for Code Generation},
  author = {Alireza Daghighfarsoodeh and Chung-Yu Wang and Hamed Taherkhani and Melika Sepidband and Mohammad Abdollahi and Hadi Hemmati and Hung Viet Pham},
  journal= {arXiv preprint arXiv:2502.18726},
  year   = {2025}
}