中文

配置编码在学习软件性能中是否重要?一项关于编码方案的实证研究

软件工程 2022-04-04 v2 人工智能

摘要

学习和预测可配置软件系统的性能有助于提供更好的质量保证。其中一个重要的工程决策是如何将配置编码到所构建的模型中。尽管存在不同的编码方案,但人们对于哪种更好以及在何种情况下更好仍知之甚少,因为社区常常依赖一些通用的信念以临时方式指导决策。为弥补这一差距,本文对用于软件性能学习的广泛使用的编码方案(即标签编码、缩放标签编码和独热编码)进行了实证比较。该研究涵盖五个系统、七种模型和三种编码方案,共形成 105 个调查案例。我们的关键发现表明:(1) 以逐案方式通过试错寻找最佳编码方案可能相当昂贵,在某些模型和系统上需要多达 400+ 小时;(2) 独热编码常带来最准确的结果,而缩放标签编码在不同模型上的准确性普遍较弱;(3) 相反,缩放标签编码往往在各模型/系统上产生最快的训练时间,而独热编码最慢;(4) 对于所有研究的模型,标签编码和缩放标签编码常在准确率和训练时间之间导致相对偏差较小的结果,但配对的模型随系统而变化。我们讨论了由发现得出的可操作建议,希望为社区提供对该主题的更好理解。为促进开放科学,本工作的数据和代码可公开访问:https://github.com/ideas-labo/MSR2022-encoding-study。

关键词

引用

@article{arxiv.2203.15988,
  title  = {Does Configuration Encoding Matter in Learning Software Performance? An Empirical Study on Encoding Schemes},
  author = {Jingzhi Gong and Tao Chen},
  journal= {arXiv preprint arXiv:2203.15988},
  year   = {2022}
}

备注

13 pages, accepted by MSR2022