随机噪声多臂盒子可学习性的完整刻画
机器学习
2025-01-20 v2 人工智能
机器学习
摘要
我们研究了具有未知奖励函数 的随机噪声多臂盒子问题,其函数属于已知函数类 。形式地,模型 将臂 映射到奖励分布 的概率分布。模型类 是模型的集合。对于每个模型 ,定义其平均奖励函数 。在多臂盒子学习问题中,我们按轮次进行,每轮抽取一个臂 并观测来自 的奖励。凭借对 的了解,假设真实模型 ,目标是在有限轮数内以高概率识别出平均奖励 接近的最大值臂 。如果可能,则称该模型类是可学习的。重要的是,\cite{hanneke2023bandit} 的结果表明,存在一些模型类,其可学习性是不可判定的。然而,他们考虑的模型类采用确定性奖励,他们提出了一个问题:对于包含足够噪声模型的模型类,是否可判定可学习性?本文首次以肯定方式回答了这个问题,通过给出具有任意噪声的模型类的可学习性的完整刻画。此外,我们还描述了所有可能的最优查询复杂度的完整谱系。进一步地,我们证明在某些情况下实现最优查询复杂度需要适应性。最后,我们重访了交互决策中重要的复杂性度量——决策-估计系数 \citep{foster2021statistical,foster2023tight},并提出了一种新的DEC变体,能够在此设置下刻画可学习性。
引用
@article{arxiv.2410.09597,
title = {A Complete Characterization of Learnability for Stochastic Noisy Bandits},
author = {Steve Hanneke and Kun Wang},
journal= {arXiv preprint arXiv:2410.09597},
year = {2025}
}