中文

面向非平稳奖励分布与延迟反馈过程的多臂老虎机策略

机器学习 2019-07-31 v3 应用统计 机器学习

摘要

本文对多种多臂老虎机(MAB)策略进行了调研,以考察它们在呈现非平稳随机奖励函数且伴随延迟反馈的情形下的表现。我们运行若干 MAB 仿真来模拟一个用于杂货取货的在线电商平台的商品可用性优化。在这项工作中,我们评估了几种流行的 MAB 策略,如 ϵ\epsilon-greedy、UCB1 和 Thompson Sampling。我们在遗憾最小化的背景下比较了各 MAB 策略的相应表现。我们在奖励函数非平稳的场景下运行分析。此外,该过程经历延迟反馈,即奖励函数不会对所拉动的臂立即响应。我们设计了一种新的自适应技术(AG1),专为延迟反馈场景下的非平稳奖励函数量身定制。仿真结果显示,在遗憾最小化的背景下,其表现优于传统 MAB 策略。

关键词

引用

@article{arxiv.1902.08593,
  title  = {Multi-Armed Bandit Strategies for Non-Stationary Reward Distributions and Delayed Feedback Processes},
  author = {Larkin Liu and Richard Downe and Joshua Reid},
  journal= {arXiv preprint arXiv:1902.08593},
  year   = {2019}
}

备注

13 pages, manuscript