中文

从$\varepsilon$-贪婪 Thompson 采样到贝叶斯优化

机器学习 2024-11-01 v3 最优化与控制 机器学习

摘要

贝叶斯优化 (BO) 已成为解决基于模拟的工程优化问题的强大工具,这得益于其整合物理和数学理解、考虑不确定性以及解决利用 - 探索困境的能力。Thompson 采样 (TS) 是 BO 处理利用 - 探索权衡的首选方案。虽然 TS 通过生成和最小化来自概率模型的随机样本路径来优先考虑探索——这是 BO 的基本要素——但 TS 在获得新观测值后收集关于真实目标函数的信息方面对利用的管理较弱。在本工作中,我们通过结合ε\varepsilon-贪婪策略(一种在强化学习中成熟的选择策略)来改进 TS 的利用。我们首先描绘了 TS 的两个极端,即通用 TS 和样本平均 TS。前者促进探索,而后者倾向于利用。然后我们采用ε\varepsilon-贪婪策略在这两个极端之间随机切换。小值和大值的ε\varepsilon分别控制利用和探索。通过最小化两个基准函数并解决钢悬臂梁的逆问题,我们实证表明,配备适当ε\varepsilonε\varepsilon-贪婪 TS 比其两个极端更具鲁棒性,能够匹配或优于通用 TS 和样本平均 TS 中较好的那个。

关键词

引用

@article{arxiv.2403.00540,
  title  = {Epsilon-Greedy Thompson Sampling to Bayesian Optimization},
  author = {Bach Do and Taiwo Adebiyi and Ruda Zhang},
  journal= {arXiv preprint arXiv:2403.00540},
  year   = {2024}
}