具有重尾奖励的低秩矩阵 Bandit
机器学习
2024-04-30 v1 机器学习
摘要
在随机低秩矩阵 bandit 中,一个臂的期望奖励等于其特征矩阵与某个未知的 低秩参数矩阵 的内积,该矩阵的秩 。以往的所有研究都假设收益混合了次高斯噪声,而在本文中,我们放宽了这一严格假设,考虑了具有重尾奖励(LowHTR)的低秩矩阵 bandit 新问题,其中奖励对于某个 仅具有有限的 阶矩。通过利用对观测收益的截断和动态探索,我们提出了一种名为 LOTUS 的新算法,在不知道 的情况下,实现了阶为 的遗憾界,当 时,这与次高斯噪声下的最先进遗憾界~\citep{lu2021low,kang2022efficient} 相匹配。此外,我们为 LowHTR 建立了阶为 的下界,这表明我们的 LOTUS 在 的阶上几乎是最优的。另外,我们改进了 LOTUS,使其不需要知道秩 ,遗憾界为 ,并且在高维场景下十分高效。我们还进行了仿真实验,以证明我们算法的实际优越性。
关键词
引用
@article{arxiv.2404.17709,
title = {Low-rank Matrix Bandits with Heavy-tailed Rewards},
author = {Yue Kang and Cho-Jui Hsieh and Thomas C. M. Lee},
journal= {arXiv preprint arXiv:2404.17709},
year = {2024}
}
备注
The 40th Conference on Uncertainty in Artificial Intelligence (UAI 2024)