基于后悔值分解的图反馈赌博机改进算法
机器学习
2023-08-07 v2 数据结构与算法
机器学习
摘要
图反馈赌博机问题通过在有向图中编码每轮游戏中损失向量如何被观测,推广了多臂赌博机(MAB)问题与专家意见学习问题。极小极大后悔值与反馈图的结构密切相关,而它们之间的联系远未被完全理解。我们基于反馈图的一个划分,为该问题提出一种新的算法框架。我们的分析通过将后悔值分解为由小局部引起的后悔值与由它们相互作用引起的后悔值之和,揭示了图各部分之间的相互作用。因此,我们的算法可视为 MAB 与专家意见学习最优算法的插值与推广。我们的框架统一了先前针对强可观测图与弱可观测图的算法,从而在包括有界度图和带少量损坏臂的强可观测图在内的广泛图族上得到改进且最优的后悔界。
引用
@article{arxiv.2205.15076,
title = {Improved Algorithms for Bandit with Graph Feedback via Regret Decomposition},
author = {Yuchen He and Chihao Zhang},
journal= {arXiv preprint arXiv:2205.15076},
year = {2023}
}