自适应约束下序贯决策的一般框架
机器学习
2023-12-07 v3 人工智能
摘要
我们首次研究了在两种自适应约束下的通用序贯决策:稀有策略切换与批量学习。首先,我们给出了一类称为 Eluder 条件类(Eluder Condition class)的通用类,其涵盖了广泛的强化学习类。随后,针对稀有策略切换约束,我们提供了一种通用算法,在 EC 类上以 的切换代价实现 的遗憾值。针对批量学习约束,我们提供了一种算法,在批次数 下实现 的遗憾值。本文是首个在通用函数类下考虑稀有策略切换与批量学习的工作,其覆盖了先前工作中研究的几乎所有模型,如表格型 MDP(Bai et al. 2019; Zhang et al. 2020)、线性 MDP(Wang et al. 2021; Gao et al. 2021)、低 eluder 维 MDP(Kong et al. 2021; Gao et al. 2021)、广义线性函数逼近(Qiao et al. 2023),以及一些新类,如低 型 Bellman eluder 维问题、线性混合 MDP、核化非线性调节器以及欠完备部分可观测马尔可夫决策过程(POMDP)。
引用
@article{arxiv.2306.14468,
title = {A General Framework for Sequential Decision-Making under Adaptivity Constraints},
author = {Nuoya Xiong and Zhaoran Wang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2306.14468},
year = {2023}
}
备注
48 pages