具有延迟反馈的对抗马尔可夫决策过程学习
机器学习
2021-12-16 v3
摘要
强化学习通常假设智能体立即观测到其动作的反馈,但在许多现实应用(如推荐系统)中,反馈是延迟观测的。本文研究具有未知转移、对抗性变化代价以及无限制延迟反馈的分段式马尔可夫决策过程(MDP)中的在线学习。即,第 段的开销与轨迹仅在第 段结束时揭示给学习器,其中延迟 既不相同也无界,且由无记忆对手选定。我们提出基于策略优化的新算法,在全信息反馈下取得 的近最优高概率后悔界,其中 为段数, 为总延迟。在 bandit 反馈下,我们证明在代价为随机时类似 的后悔界,而在一般情形下为 后悔界。我们是首个在具有延迟反馈的 MDP 这一重要设定中考虑后悔最小化的工作。
引用
@article{arxiv.2012.14843,
title = {Learning Adversarial Markov Decision Processes with Delayed Feedback},
author = {Tal Lancewicki and Aviv Rosenberg and Yishay Mansour},
journal= {arXiv preprint arXiv:2012.14843},
year = {2021}
}
备注
AAAI 2022