中文

用于树搜索的高斯过程赌博机:理论及其在折扣MDP规划中的应用

机器学习 2011-01-18 v2 人工智能

摘要

我们提出并分析了一种新的树搜索算法GPTS,该算法基于高斯过程在赌博机问题中应用的最新理论进展。我们将树路径视为臂,并假设目标/奖励函数服从GP分布。在观测到数据后,利用后验均值和方差来定义函数值的置信区间,并依序选择具有最高置信上界的臂。我们给出了GPTS的高效实现,并通过确定整个树路径集合上核矩阵特征值的衰减率,改进了先前的遗憾界。我们考虑了由树节点索引的二值向量特征空间中的两种核:线性核与高斯核。遗憾随迭代次数TT呈平方根增长(至多相差一个对数因子),且其常数项随高斯核宽度的增大而改善。我们重点关注小于臂数的TT的实际取值。最后,通过将奖励建模为独立高斯过程的折扣和,我们将GPTS应用于折扣Markov决策过程中的开环规划。我们得到了与OLOP算法相似的遗憾界。

关键词

引用

@article{arxiv.1009.0605,
  title  = {Gaussian Process Bandits for Tree Search: Theory and Application to Planning in Discounted MDPs},
  author = {Louis Dorard and John Shawe-Taylor},
  journal= {arXiv preprint arXiv:1009.0605},
  year   = {2011}
}

备注

Second draft. Tried to follow the JMLR formatting guidelines. Made corrections to the section on planning in MDPs