兼具随机性与对抗性的最优臂识别
机器学习
2026-04-17 v1 机器学习
摘要
我们研究了带有任意且可能为对抗性奖励的最佳臂识别问题。一个简单的随机均匀学习器可在对抗情景下获得最优的误差率。然而,这种策略在奖励被抽样为随机时是次优的。因此,我们提出:能否设计一种学习器,在不知晓奖励性质的情况下同时在随机和对抗问题中获得最优性能?首先,我们表明在一般情况下,设计此类学习器是不可能的。特别是,要对抗性奖励,我们只能在随机问题的子集上保证最优的误差率。我们给出一个下界,刻画了若策略受制于对抗性奖励时,随机问题中最优误差率。最后,我们设计了一个简单且无参数的算法,证明其误差概率在随机问题中与下界相当(最多只差对数因子),且对对抗情形也鲁棒。
引用
@article{arxiv.2604.14860,
title = {Best of both worlds: Stochastic & adversarial best-arm identification},
author = {Yasin Abbasi-Yadkori and Peter L. Bartlett and Victor Gabillon and Alan Malek and Michal Valko},
journal= {arXiv preprint arXiv:2604.14860},
year = {2026}
}
备注
Published in Conference on Learning Theory (COLT 2018)