中文

超参数优化对软件分析而言是否不同?

软件工程 2025-02-27 v4 机器学习

摘要

是的。软件工程数据中的类别边界可能比传统人工智能数据集更“平滑”。更精确地说,软件工程数据中损失函数的二阶导数幅度通常小得多。一种名为SMOOTHIE的新型超参数优化器可以利用软件工程数据的这一特性。我们在三个任务上比较了SMOOTHIE和一种最先进的人工智能超参数优化器:(a) GitHub问题生命周期预测;(b) 检测静态代码警告误报;(c) 缺陷预测。为完整起见,我们还展示了一些标准人工智能数据集上的实验。SMOOTHIE在软件工程数据上运行更快且预测更好,但在非软件工程数据上与人工智能工具性能相当。因此,我们得出结论:软件工程数据可能与其他类型数据不同;这些差异意味着我们应该为数据使用不同类型的算法。为支持开放科学和该领域的其他研究人员,我们的所有脚本和数据集均在线提供,网址为https://github.com/yrahul3910/smoothness-hpo/。

关键词

引用

@article{arxiv.2401.09622,
  title  = {Is Hyper-Parameter Optimization Different for Software Analytics?},
  author = {Rahul Yedida and Tim Menzies},
  journal= {arXiv preprint arXiv:2401.09622},
  year   = {2025}
}

备注

Accepted to TSE