中文

关于知识梯度算法的有限时间性能

机器学习 2022-11-23 v3 机器学习

摘要

知识梯度(KG)算法是用于最佳臂识别(BAI)问题的一种流行且有效的算法。由于 KG 的计算复杂,该算法的理论分析较为困难,现有结果大多关于其渐近性能,例如一致性、渐近样本分配等。在本研究中,我们给出了关于 KG 算法有限时间性能的新理论结果。在独立且正态分布的奖励下,我们推导了该算法样本分配的界。借助这些界,现有的渐近结果成为简单的推论。此外,我们推导了该算法错误概率和简单遗憾的上界与下界,并展示了该算法在多臂老虎机(MAB)问题上的性能。这些进展不仅扩展了现有的 KG 算法分析,也可用于分析其他基于改进的算法。最后,我们使用数值实验比较我们所推导的界与 KG 算法的性能。

关键词

引用

@article{arxiv.2206.06847,
  title  = {On the Finite-Time Performance of the Knowledge Gradient Algorithm},
  author = {Yanwen Li and Siyang Gao},
  journal= {arXiv preprint arXiv:2206.06847},
  year   = {2022}
}