具有延迟、复合与部分匿名奖励的强化学习
机器学习
2023-08-29 v2 人工智能
摘要
我们研究一种具有延迟、复合与部分匿名奖励反馈的无限 horizon 平均奖励马尔可夫决策过程(MDP)。奖励的延迟与复合意味着:在给定状态采取动作所产生的奖励被拆分为不同分量,并在延迟的时间实例上依次实现。部分匿名属性意指:对于每个状态,学习者仅观察到在该状态采取不同动作所产生、但在观察实例实现的过去奖励分量之聚合。我们提出一种名为 的算法,以在该设定下获得近最优策略,并证明其达到 的 regret 界,其中 与 分别为状态与动作空间的大小, 为 MDP 的直径, 为以最大奖励延迟为上界的一个参数, 表示时间范围。这展示了该界在 阶上的最优性,以及延迟的加性影响。
引用
@article{arxiv.2305.02527,
title = {Reinforcement Learning with Delayed, Composite, and Partially Anonymous Reward},
author = {Washim Uddin Mondal and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2305.02527},
year = {2023}
}