赌博机相位恢复
机器学习
2021-06-07 v2 机器学习
统计理论
统计方法学
统计理论
摘要
我们研究相位恢复的赌博机版本,其中学习者在 d 维单位球中选择动作 ,期望奖励为 ,其中 为未知参数向量。我们证明该问题的极小极大累积后悔为 ,较已知最优界改进了 倍。我们还证明极小极大简单后悔为 ,且仅有自适应算法才能达到该值。我们的分析表明,一种看似令人信服的猜测下界的启发式方法可能具有误导性,且信息导向采样中信息比的一致界不足以保证最优后悔。
引用
@article{arxiv.2106.01660,
title = {Bandit Phase Retrieval},
author = {Tor Lattimore and Botao Hao},
journal= {arXiv preprint arXiv:2106.01660},
year = {2021}
}