中文

互动Fano方法:面向Bandit学习的统一下界框架与刻画

机器学习 2024-12-10 v2 信息论 math.IT 统计理论 机器学习 统计理论

摘要

我们构建了一个统一的信息论下界框架,用于统计估计和互动决策。经典下界技术——如Fano方法、Le Cam方法和Assouad引理——是统计估计中最小风险研究的核心,但对于收集数据互动的算法(如bandit和强化学习算法)尚不足以提供紧致下界。最近的工作(Foster等,2021, 2023)提供了互动决策的最小下界,使用看似不同于经典方法的分析技术。这些结果——通过称为决策-估计系数(DEC)的复杂度度量证明——捕捉了互动学习特有的难度,却未能恢复被动估计的最紧下界。我们通过一种新型下界方法——互动Fano方法——提出了这些不同方法的统一视角。作为应用,我们引入一种新型复杂度度量——分数覆盖数(Fractional Covering Number),以便为互动决策提供新的下界,将估计复杂度纳入DEC方法之中。利用分数覆盖数,我们(i)为任意随机bandit问题提供了可学习性的统一刻画,(ii)在模型类为凸的情况下,关闭了Foster等人(2021, 2023)工作中上界与下界之间的剩余差距(最多仅剩多项因子)。

关键词

引用

@article{arxiv.2410.05117,
  title  = {Assouad, Fano, and Le Cam with Interaction: A Unifying Lower Bound Framework and Characterization for Bandit Learnability},
  author = {Fan Chen and Dylan J. Foster and Yanjun Han and Jian Qian and Alexander Rakhlin and Yunbei Xu},
  journal= {arXiv preprint arXiv:2410.05117},
  year   = {2024}
}