中文

自适应约束下序贯决策的一般框架

机器学习 2023-12-07 v3 人工智能

摘要

我们首次研究了在两种自适应约束下的通用序贯决策:稀有策略切换与批量学习。首先,我们给出了一类称为 Eluder 条件类(Eluder Condition class)的通用类,其涵盖了广泛的强化学习类。随后,针对稀有策略切换约束,我们提供了一种通用算法,在 EC 类上以 O~(logK)\widetilde{\mathcal{O}}(\log K) 的切换代价实现 O~(K)\widetilde{\mathcal{O}}(\sqrt{K}) 的遗憾值。针对批量学习约束,我们提供了一种算法,在批次数 BB 下实现 O~(K+K/B)\widetilde{\mathcal{O}}(\sqrt{K}+K/B) 的遗憾值。本文是首个在通用函数类下考虑稀有策略切换与批量学习的工作,其覆盖了先前工作中研究的几乎所有模型,如表格型 MDP(Bai et al. 2019; Zhang et al. 2020)、线性 MDP(Wang et al. 2021; Gao et al. 2021)、低 eluder 维 MDP(Kong et al. 2021; Gao et al. 2021)、广义线性函数逼近(Qiao et al. 2023),以及一些新类,如低 DΔD_\Delta 型 Bellman eluder 维问题、线性混合 MDP、核化非线性调节器以及欠完备部分可观测马尔可夫决策过程(POMDP)。

关键词

引用

@article{arxiv.2306.14468,
  title  = {A General Framework for Sequential Decision-Making under Adaptivity Constraints},
  author = {Nuoya Xiong and Zhaoran Wang and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2306.14468},
  year   = {2023}
}

备注

48 pages