中文

面对模糊性的乐观原则:多臂老虎机问题

机器学习 2025-02-14 v2 机器学习

摘要

跟随正则化领袖(FTRL)算法在对抗性及随机老虎机问题中常常能获得最优 regret,且允许简化的分析。然而,FTRL算法需要在每个迭代中求解优化问题,因而计算上具有挑战性。相比之下,跟随扰动领袖(FTPL)算法通过扰动臂奖励估计值来实现计算效率,但其 regret 分析却相当繁琐。我们提出了一种新的FTPL算法,为对抗性和随机多臂老虎机生成最优策略。就FTRL而言,我们的算法采用统一的 regret 分析;就FTPL而言,它具有低计算成本。不同于现有的FTPL算法依赖由已知分布决定的独立加性扰动,我们允许扰动遵循仅被认为属于给定集合中模糊分布的分布,并提出面对模糊性的乐观原则。因此,我们的框架概括了现有的FTPL算法。它还将一系列FTRL方法封装为特例,包括若干最优方法,这在当前FTPL方法中似乎不可能实现。最后,我们利用离散选择理论中的技术,构建了一个高效的二分查找算法,用于计算乐观臂采样概率。该算法在计算每个迭代中的优化问题的标准FTRL算法时,快达 10410^4 倍。我们的结果不仅解决了既存的猜想,也为扰动对FTRL到FTPL的影响提供了新见解。

关键词

引用

@article{arxiv.2409.20440,
  title  = {Optimism in the Face of Ambiguity Principle for Multi-Armed Bandits},
  author = {Mengmeng Li and Daniel Kuhn and Bahar Taşkesen},
  journal= {arXiv preprint arXiv:2409.20440},
  year   = {2025}
}