中文

非平稳核化 bandits 的近最优算法

机器学习 2024-10-22 v1 机器学习

摘要

本文研究了非平稳核化 bandit(KB)问题,亦称时间变动的贝叶斯优化,在该问题中需在随时间变化的未知奖励函数下最小化报酬。本文特别关注一种近最优算法,其报酬上界与报酬下界相吻合。为此目标,我们首次提出了非平稳 KB 在平方指数核和 Matérn 核下的算法独立报酬下界,这表明已有基于优化的 KB 算法经过轻微修改后即接近最优。然而,该已有算法因计算成本极大而面临可行性问题。因此,我们提出了一种新的近最优算法,称为基于随机置换的相位消除重启(R-PERP),以规避巨大的计算成本。技术关键点在于查询候选者的简单置换程序,这使我们能够推导针对非平稳问题的新型更紧致的置信区间。

关键词

引用

@article{arxiv.2410.16052,
  title  = {Near-Optimal Algorithm for Non-Stationary Kernelized Bandits},
  author = {Shogo Iwazaki and Shion Takeno},
  journal= {arXiv preprint arXiv:2410.16052},
  year   = {2024}
}

备注

24 pages, 2 figures