中文

GEC: MDP、POMDP 及更广泛交互式决策的统一框架

机器学习 2023-07-03 v4 人工智能 最优化与控制 机器学习

摘要

我们在交互式决策的一般框架下研究样本高效的强化学习(RL),该框架将马尔可夫决策过程(MDP)、部分可观测马尔可夫决策过程(POMDP)和预测状态表示(PSR)作为特例包含在内。为寻找能够实现样本高效学习的最小假设,我们提出一种新的复杂度度量——广义 eluder 系数(GEC),它刻画了在线交互式决策中探索与利用之间的基本权衡。具体而言,GEC 通过比较更新策略性能预测的误差与在历史数据上评估的样本内训练误差来刻画探索的难度。我们表明,低 GEC 的 RL 问题构成了一个极为丰富的类别,它包含了低 Bellman eluder 维问题、双线性类、低 witness 秩问题、PO-双线性类以及广义正则 PSR,其中广义正则 PSR 是我们识别出的一个新的可处理 PSR 类,几乎包含了所有已知可处理的 POMDP 和 PSR。此外,在算法设计方面,我们提出了一种通用后验采样算法,可在无模型与基于模型两种形式下、以及在完全可观测与部分可观测设置下实现。所提算法在两处修改了标准后验采样算法:(i) 我们使用偏向具有更高价值假设的乐观先验分布;(ii) 对数似然函数设为在历史数据上评估的经验损失,其中损失函数的选择支持无模型与基于模型学习。我们通过建立关于 GEC 的次线性后悔上界,证明了所提算法是样本高效的。总之,我们为完全可观测与部分可观测 RL 提供了新颖且统一的理解。

关键词

引用

@article{arxiv.2211.01962,
  title  = {GEC: A Unified Framework for Interactive Decision Making in MDP, POMDP, and Beyond},
  author = {Han Zhong and Wei Xiong and Sirui Zheng and Liwei Wang and Zhaoran Wang and Zhuoran Yang and Tong Zhang},
  journal= {arXiv preprint arXiv:2211.01962},
  year   = {2023}
}

备注

We changed the title from the first version. We fixed a technical issue in the first version regarding the $\ell_2$ eluder technique (Lemma D.2)