深度学习框架开发中假设自动识别的探索性研究
摘要
利益相关者在深度学习(DL)框架开发中不断做出假设。这些假设与各种类型的软件制品(如需求、设计决策和技术债务)相关,并可能被证明是无效的,从而导致系统故障。现有的假设管理方法和工具通常依赖于人工识别假设。然而,假设散布在 DL 框架开发的各种来源(如代码注释、提交、拉取请求和议题)中,人工识别假设的成本很高。本研究旨在从开发者和用户的角度,在 GitHub 上的 DL 框架项目(即议题、拉取请求和提交)的背景下,评估用于假设识别的不同分类模型。首先,我们构建了一个新的且规模最大的假设数据集(即 AssuEval 数据集),该数据集收集自 GitHub 上的 TensorFlow 和 Keras 仓库。然后,我们在 AssuEval 数据集上探索了七个非 Transformer 模型(如支持向量机、分类与回归树)、ALBERT 模型以及三个仅解码器模型(即 ChatGPT、Claude 和 Gemini)在识别假设方面的性能。研究结果表明,ALBERT 在 AssuEval 数据集上识别假设取得了最佳性能(f1-score: 0.9584),远优于其他模型(第二好的 f1-score 为 0.8858,由 Claude 3.5 Sonnet 模型取得)。尽管 ChatGPT、Claude 和 Gemini 是流行的模型,但由于其性能较低,我们不建议使用它们来识别 DL 框架开发中的假设。专门针对假设对 ChatGPT、Claude、Gemini 或其他语言模型(如 Llama3、Falcon 和 BLOOM)进行微调,可能会提高它们在假设识别方面的性能。
引用
@article{arxiv.2401.03653,
title = {An Exploratory Study on Automatic Identification of Assumptions in the Development of Deep Learning Frameworks},
author = {Chen Yang and Peng Liang and Zinan Ma},
journal= {arXiv preprint arXiv:2401.03653},
year = {2024}
}
备注
Preprint accepted for publication in Science of Computer Programming, 2024