中文

将策略视为老虎机臂在树 MDP 中的在线学习

人工智能 2026-05-07 v1 机器学习

摘要

树马尔可夫决策问题(T-MDP)是一个具有起始状态 s1s_{1} 的有限时域 MDP,其中每个状态都可以从 s1s_{1} 经过恰好一条状态-动作轨迹到达。T-MDP 自然地作为具有完美回忆的序贯博弈中针对平稳对手决策制定的抽象而出现。我们考虑了 T-MDP 中的在线学习问题,涵盖了 PAC 和最小遗憾两种机制。我们展示了著名的赌博机算法——\textsc{Lucb} 和 \textsc{Ucb}——可以通过将每个策略视为一个臂应用于 T-MDP。这种方法面临的明显技术挑战是,策略的数量相对于状态数量呈指数级增长。我们的主要创新在于设计了基于策略间共享数据的置信区间,使得赌博机算法仍可以在多项式内存和单步计算复杂度下实现。我们获得了样本复杂度和遗憾的实例相关上界,这些上界是对每个终止状态的“间隔项”求和,而不是对每个策略求和。在实验中,我们的算法在一套隐藏信息博弈上始终优于现有的替代方法。

关键词

引用

@article{arxiv.2605.04979,
  title  = {On-line Learning in Tree MDPs by Treating Policies as Bandit Arms},
  author = {Anvay Shah and Ramsundar Anandanarayanan and Sharayu Moharir and Shivaram Kalyanakrishnan},
  journal= {arXiv preprint arXiv:2605.04979},
  year   = {2026}
}

备注

Accepted as a full paper in the Main Track of AAMAS 2026