中文

利用高斯过程老虎机优化并行化探索-利用权衡

机器学习 2012-07-03 v1 机器学习

摘要

能否并行化复杂的探索-利用权衡?以最优高通量实验设计问题为例,我们希望顺序设计批量实验,以同时学习从刺激到响应的代理函数并确定函数的最大值。我们将该任务形式化为多臂老虎机问题,其中未知收益函数从高斯过程(GP)中采样,并且在每一轮中,我们不是拉动单个臂,而是并行拉动一批臂。我们开发了GP-BUCB,一种基于顺序GP优化算法GP-UCB的、用于选择批量的原则性算法。我们证明了一个令人惊讶的结果:与顺序方法相比,并行算法的累积遗憾仅增加一个与批量大小B无关的常数因子。我们的结果为贝叶斯全局优化中利用并行性提供了严格的理论支持。我们在两个实际应用中展示了我们方法的有效性。

关键词

引用

@article{arxiv.1206.6402,
  title  = {Parallelizing Exploration-Exploitation Tradeoffs with Gaussian Process Bandit Optimization},
  author = {Thomas Desautels and Andreas Krause and Joel Burdick},
  journal= {arXiv preprint arXiv:1206.6402},
  year   = {2012}
}

备注

Appears in Proceedings of the 29th International Conference on Machine Learning (ICML 2012)