人工智能中的竞赛——利用统计重采样对求解器进行稳健排序
人工智能
2023-08-10 v1
摘要
求解器竞赛在评估和推进人工智能及更广泛领域中诸多问题的求解水平方面发挥着突出作用。值得注意的是,在人工智能的许多领域,竞赛多年来对指导研究和应用产生了实质影响,且求解器在竞赛中排名靠前具有重要分量。但我们在多大程度上可以期望竞赛结果推广到不同于特定竞赛所用的问题实例集?这是我们在此使用统计重采样技术所研究的问题。我们表明,对竞赛结果标准解读所得的排名对作为评估基础的基准实例集即使微小变动也可能非常敏感,因此无法期望其能延续到来自同一底层实例分布的其他样本。为解决此问题,我们引入一种基于重采样性能数据对竞赛结果进行具统计意义分析的新方法。我们的方法生成竞赛得分的置信区间以及具有有界误差的统计稳健求解器排名。应用于近期的 SAT、AI 规划和计算机视觉竞赛,我们的分析揭示了求解器性能中频繁的统计平局,以及与基于简单评分的官方结果相比的一些排名倒置。
引用
@article{arxiv.2308.05062,
title = {Competitions in AI -- Robustly Ranking Solvers Using Statistical Resampling},
author = {Chris Fawcett and Mauro Vallati and Holger H. Hoos and Alfonso E. Gerevini},
journal= {arXiv preprint arXiv:2308.05062},
year = {2023}
}