中文

DNN4SE实验中的陷阱:实践现状分析

软件工程 2023-05-22 v1

摘要

软件工程技术日益依赖深度学习方法以支持众多软件工程任务,从缺陷分派到代码生成。为评估此类技术的效能,研究者通常进行受控实验。然而,鉴于所涉变量空间的复杂性,开展这些实验尤其具有挑战性:从专门而错综的架构与算法,到大量训练超参数与不断演进的数据集的选择,再叠加机器学习技术飞速发展的背景,以及训练过程中固有的随机性来源。在本工作中,我们进行了一项映射研究,考察了55篇发表于顶级软件工程会议、依赖深度神经网络的194项实验,以刻画实践现状,指出实验中的常见趋势与陷阱。我们的研究揭示,大多数实验(包括那些已获得ACM制品徽章的实验)存在根本性局限,令人对其发现的可靠性产生怀疑。更具体地,我们发现:用于确定自变量与因变量间存在真实关系的分析薄弱(87%的实验);对DNN相关变量空间的控制有限,这可能使因变量与处理间的关系非因果而仅为相关(100%的实验);缺乏关于实验中使用的DNN变量及其取值的明确说明(86%的实验)以界定所施加的处理,这使得不清楚所评估的究竟是设计出的技术,还是如何控制外来变异来源。我们提供了一些应对这些局限的实用建议。

关键词

引用

@article{arxiv.2305.11556,
  title  = {Pitfalls in Experiments with DNN4SE: An Analysis of the State of the Practice},
  author = {Sira Vegas and Sebastian Elbaum},
  journal= {arXiv preprint arXiv:2305.11556},
  year   = {2023}
}