中文

批量汤普森采样

机器学习 2021-10-04 v1

摘要

我们为多臂老虎机引入了一种新颖的任意时刻批量汤普森采样策略,其中智能体观察其动作的奖励,并仅在一小批批次结束时调整其策略。我们证明该策略同时实现了阶为O(log(T))O(\log(T))的问题相关后悔(regret)与阶为O(Tlog(T))O(\sqrt{T\log(T)})的极小极大后悔,而批次数可界于O(log(T))O(\log(T))(独立于时间范围TT上的问题实例)。我们还证明,期望意义上我们策略所用批次数可界于阶为O(loglog(T))O(\log\log(T))的实例相关界。这些结果表明,汤普森采样在该批量设定下保持了与每次动作后可得即时反馈情形相同的性能,同时仅需极少的反馈。这些结果也表明汤普森采样与近期提出的专为批量设定设计的算法相比具有竞争力。这些算法针对给定时间范围TT优化批次结构,并在实验初期优先探索以剔除次优动作。我们展示了结合自适应批处理策略的汤普森采样可在不知晓问题时间范围TT、且无需为给定TT仔细优化批次结构以达成目标后悔界(即问题相关与极小极大后悔)的情况下取得相似性能。

关键词

引用

@article{arxiv.2110.00202,
  title  = {Batched Thompson Sampling},
  author = {Cem Kalkanli and Ayfer Ozgur},
  journal= {arXiv preprint arXiv:2110.00202},
  year   = {2021}
}

备注

This work is accepted to Thirty-fifth Conference on Neural Information Processing Systems, NeurIPS 2021