中文

具有重尾奖励的低秩矩阵 Bandit

机器学习 2024-04-30 v1 机器学习

摘要

在随机低秩矩阵 bandit 中,一个臂的期望奖励等于其特征矩阵与某个未知的 d1×d2d_1 \times d_2 低秩参数矩阵 Θ\Theta^* 的内积,该矩阵的秩 rd1d2r \ll d_1 \wedge d_2。以往的所有研究都假设收益混合了次高斯噪声,而在本文中,我们放宽了这一严格假设,考虑了具有重尾奖励(LowHTR)的低秩矩阵 bandit 新问题,其中奖励对于某个 δ(0,1]\delta \in (0,1] 仅具有有限的 (1+δ)(1+\delta) 阶矩。通过利用对观测收益的截断和动态探索,我们提出了一种名为 LOTUS 的新算法,在不知道 TT 的情况下,实现了阶为 O~(d32r12T11+δ/D~rr)\tilde O(d^\frac{3}{2}r^\frac{1}{2}T^\frac{1}{1+\delta}/\tilde{D}_{rr}) 的遗憾界,当 δ=1\delta = 1 时,这与次高斯噪声下的最先进遗憾界~\citep{lu2021low,kang2022efficient} 相匹配。此外,我们为 LowHTR 建立了阶为 Ω(dδ1+δrδ1+δT11+δ)=Ω(T11+δ)\Omega(d^\frac{\delta}{1+\delta} r^\frac{\delta}{1+\delta} T^\frac{1}{1+\delta}) = \Omega(T^\frac{1}{1+\delta}) 的下界,这表明我们的 LOTUS 在 TT 的阶上几乎是最优的。另外,我们改进了 LOTUS,使其不需要知道秩 rr,遗憾界为 O~(dr32T1+δ1+2δ)\tilde O(dr^\frac{3}{2}T^\frac{1+\delta}{1+2\delta}),并且在高维场景下十分高效。我们还进行了仿真实验,以证明我们算法的实际优越性。

关键词

引用

@article{arxiv.2404.17709,
  title  = {Low-rank Matrix Bandits with Heavy-tailed Rewards},
  author = {Yue Kang and Cho-Jui Hsieh and Thomas C. M. Lee},
  journal= {arXiv preprint arXiv:2404.17709},
  year   = {2024}
}

备注

The 40th Conference on Uncertainty in Artificial Intelligence (UAI 2024)