多臂老虎机情景下的搜索启发式方法分析
神经与进化计算
2026-04-10 v1
摘要
我们在经典的多臂老虎机情景下考察不同搜索启发式方法的探索/利用权衡。由于许多搜索启发式方法通过比较不同选项来工作(在进化算法中称为"individuals",在老虎机文献中称为"arms"),我们采用"Dueling Bandits"情景。在每个迭代中,可以对不同臂进行比较;在二项随机情景下,每个臂对任何其他臂都有固定的赢得概率。拥有所有其他臂概率严格大于 的臂称为Condorcet赢家。我们指出,进化算法在识别Condorcet赢家方面相当不理想:即使Condorcet赢家以概率 赢得所有其他臂,(1+1) EA 在其平稳分布中仅以常数概率选择Condorcet赢家,当 时。相比之下,我们表明,一个简单的EDA(基于Max-Min Ant System with iteration-best update)将以概率 选择Condorcet赢家。对于(1+1) EA,我们表明通过重复对决可以显著提升Condorcet赢家在平稳分布中的概率。
引用
@article{arxiv.2604.08109,
title = {Analysis of Search Heuristics in the Multi-Armed Bandit Setting},
author = {Jasmin Brandt and Barbara Hammer and Timo Kötzing and Jurek Sander},
journal= {arXiv preprint arXiv:2604.08109},
year = {2026}
}
备注
16 pages, 5 figures, GECCO 2026