中文

具有延迟、复合与部分匿名奖励的强化学习

机器学习 2023-08-29 v2 人工智能

摘要

我们研究一种具有延迟、复合与部分匿名奖励反馈的无限 horizon 平均奖励马尔可夫决策过程(MDP)。奖励的延迟与复合意味着:在给定状态采取动作所产生的奖励被拆分为不同分量,并在延迟的时间实例上依次实现。部分匿名属性意指:对于每个状态,学习者仅观察到在该状态采取不同动作所产生、但在观察实例实现的过去奖励分量之聚合。我们提出一种名为 DUCRL2\mathrm{DUCRL2} 的算法,以在该设定下获得近最优策略,并证明其达到 O~(DSAT+d(SA)3)\tilde{\mathcal{O}}\left(DS\sqrt{AT} + d (SA)^3\right) 的 regret 界,其中 SSAA 分别为状态与动作空间的大小,DD 为 MDP 的直径,dd 为以最大奖励延迟为上界的一个参数,TT 表示时间范围。这展示了该界在 TT 阶上的最优性,以及延迟的加性影响。

关键词

引用

@article{arxiv.2305.02527,
  title  = {Reinforcement Learning with Delayed, Composite, and Partially Anonymous Reward},
  author = {Washim Uddin Mondal and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2305.02527},
  year   = {2023}
}