中文

赌博机相位恢复

机器学习 2021-06-07 v2 机器学习 统计理论 统计方法学 统计理论

摘要

我们研究相位恢复的赌博机版本,其中学习者在 d 维单位球中选择动作 (At)t=1n(A_t)_{t=1}^n,期望奖励为 At,θ2\langle A_t, \theta_\star\rangle^2,其中 θRd\theta_\star \in \mathbb R^d 为未知参数向量。我们证明该问题的极小极大累积后悔为 Θ~(dn)\smash{\tilde \Theta(d \sqrt{n})},较已知最优界改进了 d\smash{\sqrt{d}} 倍。我们还证明极小极大简单后悔为 Θ~(d/n)\smash{\tilde \Theta(d / \sqrt{n})},且仅有自适应算法才能达到该值。我们的分析表明,一种看似令人信服的猜测下界的启发式方法可能具有误导性,且信息导向采样中信息比的一致界不足以保证最优后悔。

关键词

引用

@article{arxiv.2106.01660,
  title  = {Bandit Phase Retrieval},
  author = {Tor Lattimore and Botao Hao},
  journal= {arXiv preprint arXiv:2106.01660},
  year   = {2021}
}