面向自适应对手的有向无环图中基于多臂老 bayesian Bandit Feedback 的在线最短路近最优算法
机器学习
2025-04-04 v1 计算机科学与博弈论
摘要
本文研究了在面向自适应对手的有向无环图(DAG)中的在线最短路问题。给定DAG ,其中源节点为 ,汇节点为 ,设 为从 到 的所有路径集合。在每一轮 ,我们选择一条路径 ,并接收关于损失 的多臂老 bayesian Bandit Feedback,其中 为对手选择的损失向量。我们的目标是针对 轮的最优路径实现低 regret。我们提出了首个在任意自适应对手下实现 的近最小混沌最优 regret 上界的高效算法,其中 隐藏了边数 的对数因子。我们的算法利用新颖的损失估计器和非平凡的方式下的质心基分解,以实现该 regret 上界。作为应用,我们表明针对DAG的算法为 -sets、广义博弈、军官布洛托游戏、有向图中最短步、超立方体以及多任务多臂老 bayesian Bandit 提供了最先进的高效算法, 在所有这些设置下均实现了改进的高概率 regret 保证。
引用
@article{arxiv.2504.00461,
title = {Efficient Near-Optimal Algorithm for Online Shortest Paths in Directed Acyclic Graphs with Bandit Feedback Against Adaptive Adversaries},
author = {Arnab Maiti and Zhiyuan Fan and Kevin Jamieson and Lillian J. Ratliff and Gabriele Farina},
journal= {arXiv preprint arXiv:2504.00461},
year = {2025}
}
备注
48 pages, 8 figures