中文

具有 Lipschitz 连续奖励函数的高斯过程规划:迈向统一贝叶斯优化、主动学习及其他

机器学习 2015-11-24 v1 人工智能 机器学习 机器人学

摘要

本文提出了一种新颖的、具有非短视自适应高斯过程规划(GPP)框架,其配备一类通用的 Lipschitz 连续奖励函数,能够统一某些主动学习/感知和贝叶斯优化准则,并为实践者提供指定其所需选择以定义新任务/问题的灵活性。特别地,它利用一个有原则的贝叶斯序贯决策问题框架来联合且自然地优化探索-利用权衡。通常,由于候选观测的不可数集,所诱导的 GPP 策略无法精确导出。因此,我们工作的一个关键贡献在于利用奖励函数的 Lipschitz 连续性来求解非短视自适应 epsilon-最优 GPP(epsilon-GPP)策略。为了实时规划,我们进一步提出了一种渐近最优的、带性能保证的 epsilon-GPP 分支定界任意时间变体。我们通过实验证明了我们的 epsilon-GPP 策略及其任意时间变体在贝叶斯优化和能量收集任务中的有效性。

关键词

引用

@article{arxiv.1511.06890,
  title  = {Gaussian Process Planning with Lipschitz Continuous Reward Functions: Towards Unifying Bayesian Optimization, Active Learning, and Beyond},
  author = {Chun Kai Ling and Kian Hsiang Low and Patrick Jaillet},
  journal= {arXiv preprint arXiv:1511.06890},
  year   = {2015}
}

备注

30th AAAI Conference on Artificial Intelligence (AAAI 2016), Extended version with proofs, 17 pages