中文

面向自适应对手的有向无环图中基于多臂老 bayesian Bandit Feedback 的在线最短路近最优算法

机器学习 2025-04-04 v1 计算机科学与博弈论

摘要

本文研究了在面向自适应对手的有向无环图(DAG)中的在线最短路问题。给定DAG G=(V,E)G = (V, E),其中源节点为 vsv_{\mathsf{s}},汇节点为 vtv_{\mathsf{t}},设 X{0,1}EX \subseteq \{0,1\}^{|E|} 为从 vsv_{\mathsf{s}}vtv_{\mathsf{t}} 的所有路径集合。在每一轮 tt,我们选择一条路径 xtX\mathbf{x}_t \in X,并接收关于损失 xt,yt[1,1]\langle \mathbf{x}_t, \mathbf{y}_t \rangle \in [-1,1] 的多臂老 bayesian Bandit Feedback,其中 yt\mathbf{y}_t 为对手选择的损失向量。我们的目标是针对 TT 轮的最优路径实现低 regret。我们提出了首个在任意自适应对手下实现 O~(ETlogX)\tilde O(\sqrt{|E|T\log |X|}) 的近最小混沌最优 regret 上界的高效算法,其中 O~()\tilde O(\cdot) 隐藏了边数 E|E| 的对数因子。我们的算法利用新颖的损失估计器和非平凡的方式下的质心基分解,以实现该 regret 上界。作为应用,我们表明针对DAG的算法为 mm-sets、广义博弈、军官布洛托游戏、有向图中最短步、超立方体以及多任务多臂老 bayesian Bandit 提供了最先进的高效算法, 在所有这些设置下均实现了改进的高概率 regret 保证。

关键词

引用

@article{arxiv.2504.00461,
  title  = {Efficient Near-Optimal Algorithm for Online Shortest Paths in Directed Acyclic Graphs with Bandit Feedback Against Adaptive Adversaries},
  author = {Arnab Maiti and Zhiyuan Fan and Kevin Jamieson and Lillian J. Ratliff and Gabriele Farina},
  journal= {arXiv preprint arXiv:2504.00461},
  year   = {2025}
}

备注

48 pages, 8 figures