关于基准测试套件用于算法比较的评估
神经与进化计算
2021-04-16 v1 数据结构与算法
摘要
基准测试套件,即一组基准函数的集合,被广泛用于黑盒优化算法的比较。多年来,研究已识别出基准测试套件的许多期望特性,例如多样的拓扑结构、不同的难度、可扩展性、对现实问题的代表性等。然而,尽管拓扑特征已受到先前研究的关注,尚无研究从统计上评估基准函数的难度水平、它们区分优化算法的程度,以及一个基准测试套件对算法比较的适用程度。在本文中,我们提出使用项目反应理论(IRT)模型,即针对多次尝试的贝叶斯双参数 logistic 模型,基于算法的经验成功率从统计上评估这些方面。利用该模型,我们可以评估每个基准的难度水平、它们区分不同算法的程度、算法的能力分数,以及基准测试套件在能力分数估计中增加的信息量。我们在两个著名的基准测试套件中演示了该模型的使用:用于连续优化的黑盒优化基准(BBOB)和用于离散优化的伪布尔优化(PBO)。我们发现 BBOB 套件的大多数基准函数具有较高难度水平(相对于优化算法)和较低的区分度。对于 PBO,大多数函数具有良好的区分参数但常被认为过于简单。我们讨论了 IRT 在基准测试中的潜在用途,包括改进基准测试套件设计、度量算法的多方面特性,以及设计自适应套件。
引用
@article{arxiv.2104.07381,
title = {On the Assessment of Benchmark Suites for Algorithm Comparison},
author = {David Issa Mattos and Lucas Ruud and Jan Bosch and Helena Holmström Olsson},
journal= {arXiv preprint arXiv:2104.07381},
year = {2021}
}
备注
In submission