中文

基于预测采样的非平稳老虎机学习

机器学习 2025-05-06 v8 机器学习

摘要

汤普森采样在广泛的平稳老虎机环境中被证明是有效的。然而,正如我们在本文中所展示的,当应用于非平稳环境时,它的表现可能很差。我们将此类失败归因于以下事实:在探索时,该算法并未根据所获取信息因非平稳性而丧失其有用性的快慢来区分动作。基于这一洞见,我们提出了预测采样,一种降低获取快速丧失有用性信息优先级的算法。通过贝叶斯后悔界建立了预测采样性能的理论保证。我们提供了预测采样的若干版本,其计算可便捷扩展到实际感兴趣的复杂老虎机环境。通过数值模拟,我们证明了预测采样在所有考察的非平稳环境中均优于汤普森采样。

关键词

引用

@article{arxiv.2205.01970,
  title  = {Non-Stationary Bandit Learning via Predictive Sampling},
  author = {Yueyang Liu and Xu Kuang and Benjamin Van Roy},
  journal= {arXiv preprint arXiv:2205.01970},
  year   = {2025}
}