中文

具有一般图反馈的随机与对抗多臂_bandit_的同时学习

机器学习 2022-08-23 v2

摘要

具有图反馈的在线学习问题因其通用性及建模多种学习任务的潜力而在文献中被广泛研究。现有工作主要分别研究对抗性和随机性反馈。若反馈机制的先验知识不可用或错误,此类专门设计的算法可能遭受巨大损失。为避免该问题,\citet{erez2021towards}尝试针对两种环境进行优化。然而,他们假设反馈图是无向的且每个顶点具有自环,这削弱了框架的通用性且可能在应用中无法满足。在一般反馈图下,拉动某臂时该臂的观测可能不可用,这使得探索代价更高,且算法更难在两种环境中均达到最优。在这项工作中,我们通过一种具有精心设计的探索与利用比例的新权衡机制克服了这一困难。我们证明所提算法在随机设置下同时实现polylogT\mathrm{poly} \log T后悔,在对抗设置下实现O~(T2/3)\tilde{O}(T^{2/3})的极小极大最优后悔,其中TT为时间范围,O~\tilde{O}隐藏与TT无关的参量及对数项。据我们所知,这是针对一般反馈图的首个兼得两种世界最优的结果。

关键词

引用

@article{arxiv.2206.07908,
  title  = {Simultaneously Learning Stochastic and Adversarial Bandits with General Graph Feedback},
  author = {Fang Kong and Yichi Zhou and Shuai Li},
  journal= {arXiv preprint arXiv:2206.07908},
  year   = {2022}
}

备注

Published in ICML 2022