时变高斯过程 Bandit 优化
机器学习
2016-01-26 v1 机器学习
摘要
我们考虑具有 bandit 反馈的顺序贝叶斯优化问题,采用允许奖励函数随时间变化的公式。我们使用高斯过程对奖励函数建模,其演化遵循简单的马尔可夫模型。我们引入经典高斯过程置信上界(GP-UCB)算法的两种自然扩展。第一种 R-GP-UCB 定期重置 GP-UCB。第二种 TV-GP-UCB 则以平滑方式遗忘旧数据。我们的主要贡献在于为这些算法提供了新颖的悔界(regret bounds),明确刻画了时间范围与函数变化率之间的权衡。我们在合成和真实数据上展示了算法性能,发现 TV-GP-UCB 的渐进遗忘相较于 R-GP-UCB 的急剧重置表现更优。此外,两种算法均显著优于经典 GP-UCB,因其平等对待陈旧与新数据。
引用
@article{arxiv.1601.06650,
title = {Time-Varying Gaussian Process Bandit Optimization},
author = {Ilija Bogunovic and Jonathan Scarlett and Volkan Cevher},
journal= {arXiv preprint arXiv:1601.06650},
year = {2016}
}
备注
To appear in AISTATS 2016