中文

广义低秩矩阵赌博机问题的高效框架

机器学习 2024-01-17 v1 机器学习

摘要

在随机上下文低秩矩阵赌博机问题中,一个动作的期望奖励由该动作的特征矩阵与某个固定但初始未知的 d1×d2d_1 \times d_2 矩阵 Θ\Theta^*(秩 r{d1,d2}r \ll \{d_1, d_2\})的内积给出,智能体根据过往经验顺序采取动作以最大化累积奖励。本文研究广义低秩矩阵赌博机问题,该问题最近在广义线性模型(GLM)框架下由 \cite{lu2021low} 提出。为克服现有算法在该问题上的计算不可行性和理论限制,我们首先提出 G-ESTT 框架,该框架修改了 \cite{jun2019bilinear} 的思想,在子空间估计中使用 Stein 方法,然后通过正则化思想利用估计的子空间。此外,我们通过一种新颖的排除思想在估计子空间上显著提高了 G-ESTT 的效率,并提出了 G-ESTS 框架。我们还证明,在温和假设下(忽略对数项),G-ESTT 可以达到 O~((d1+d2)MrT)\tilde{O}(\sqrt{(d_1+d_2)MrT}) 的遗憾界,而 G-ESTS 可以达到 O~((d1+d2)3/2Mr3/2T)\tilde{O}(\sqrt{(d_1+d_2)^{3/2}Mr^{3/2}T}) 的遗憾界,其中 MM 是某个问题相关值。在我们的问题设定下,合理假设 M=O((d1+d2)2)M = O((d_1+d_2)^2) 时,G-ESTT 的遗憾与当前最优遗憾 O~((d1+d2)3/2rT/Drr)\tilde{O}((d_1+d_2)^{3/2} \sqrt{rT}/D_{rr})~\citep{lu2021low}(DrrD_{rr} 将在后文定义)一致。为完整性起见,我们通过一系列模拟实验表明,我们提出的算法,尤其是 G-ESTS,在计算上也是可行的,并且持续优于其他最先进的(广义)线性矩阵赌博机方法。

关键词

引用

@article{arxiv.2401.07298,
  title  = {Efficient Frameworks for Generalized Low-Rank Matrix Bandit Problems},
  author = {Yue Kang and Cho-Jui Hsieh and Thomas C. M. Lee},
  journal= {arXiv preprint arXiv:2401.07298},
  year   = {2024}
}

备注

Revision of the paper accepted by NeurIPS 2022