更简单的软件分析超参数优化:为何、如何、何时?
软件工程
2021-04-26 v2
摘要
如何使软件分析更简单、更快速?一种方法是将分析的复杂度与所探索数据的内在复杂度相匹配。例如,超参数优化器为数据挖掘器寻找控制设置,以改进通过软件分析生成的预测。有时,只需 DODGE(避开以往尝试)即可实现非常快速的超参数优化。但何时使用 DODGE 是明智的,何时又必须使用更复杂(且慢得多)的优化器?为回答此问题,我们将超参数优化应用于 120 个 SE(软件工程)数据集,涉及坏味检测、预测 Github issue 关闭时间、缺陷报告分析、缺陷预测以及数十个其他非 SE 问题。我们发现,DODGE 在“内在维度”低(D = 3)的数据集上效果最佳,而在高维数据(D 超过 8)上表现很差。此处所见几乎所有 SE 数据都具有内在低维特性,表明 DODGE 适用于许多 SE 分析任务。
引用
@article{arxiv.2008.07334,
title = {Simpler Hyperparameter Optimization for Software Analytics: Why, How, When?},
author = {Amritanshu Agrawal and Xueqi Yang and Rishabh Agrawal and Xipeng Shen and Tim Menzies},
journal= {arXiv preprint arXiv:2008.07334},
year = {2021}
}
备注
made a mistake with my co-author. the current version of this doc is their version arXiv:1912.04061