中文

时变高斯过程 Bandit 优化

机器学习 2016-01-26 v1 机器学习

摘要

我们考虑具有 bandit 反馈的顺序贝叶斯优化问题,采用允许奖励函数随时间变化的公式。我们使用高斯过程对奖励函数建模,其演化遵循简单的马尔可夫模型。我们引入经典高斯过程置信上界(GP-UCB)算法的两种自然扩展。第一种 R-GP-UCB 定期重置 GP-UCB。第二种 TV-GP-UCB 则以平滑方式遗忘旧数据。我们的主要贡献在于为这些算法提供了新颖的悔界(regret bounds),明确刻画了时间范围与函数变化率之间的权衡。我们在合成和真实数据上展示了算法性能,发现 TV-GP-UCB 的渐进遗忘相较于 R-GP-UCB 的急剧重置表现更优。此外,两种算法均显著优于经典 GP-UCB,因其平等对待陈旧与新数据。

关键词

引用

@article{arxiv.1601.06650,
  title  = {Time-Varying Gaussian Process Bandit Optimization},
  author = {Ilija Bogunovic and Jonathan Scarlett and Volkan Cevher},
  journal= {arXiv preprint arXiv:1601.06650},
  year   = {2016}
}

备注

To appear in AISTATS 2016