中文

富动作集线性_bandit中的探索及其对推断的启示

机器学习 2023-01-10 v3 人工智能 机器学习

摘要

我们给出了当动作集具有良好曲率时,任何具有次线性后悔的线性 bandit 算法所生成设计矩阵特征谱的非渐近下界。具体而言,我们表明只要算法的期望累积后悔为 O(n)O(\sqrt{n}),期望设计矩阵的最小特征值便以 Ω(n)\Omega(\sqrt{n}) 增长,其中 nn 为学习时域,且动作空间在最优臂附近具有常值 Hessian。这表明此类动作空间迫使产生多项式下界,而非如 \cite{lattimore2017end} 在离散(即良好分离)动作空间中所证明的对数下界。此外,先前结果仅被证明在渐近情形(当 nn \to \infty)下成立,而我们针对这些“局部富”动作空间的结果则是任意时刻均成立的。另外,在一个温和技术假设下,我们得到了以高概率成立的最小特征值的类似下界。我们将结果应用于两个实际场景——线性 bandit 中的\emph{模型选择}与\emph{聚类}。对于模型选择,我们表明基于轮次的线性 bandit 算法借助我们的新谱界,能以轮次数量的指数速率自适应于真实模型复杂度。对于聚类,我们考虑多智能体框架,通过利用该谱结果证明无需强制探索——智能体可运行线性 bandit 算法并一次性估计其底层参数,从而承受低后悔。

关键词

引用

@article{arxiv.2207.11597,
  title  = {Exploration in Linear Bandits with Rich Action Sets and its Implications for Inference},
  author = {Debangshu Banerjee and Avishek Ghosh and Sayak Ray Chowdhury and Aditya Gopalan},
  journal= {arXiv preprint arXiv:2207.11597},
  year   = {2023}
}

备注

Resubmit