中文

具有延迟反馈的对抗马尔可夫决策过程学习

机器学习 2021-12-16 v3

摘要

强化学习通常假设智能体立即观测到其动作的反馈,但在许多现实应用(如推荐系统)中,反馈是延迟观测的。本文研究具有未知转移、对抗性变化代价以及无限制延迟反馈的分段式马尔可夫决策过程(MDP)中的在线学习。即,第 kk 段的开销与轨迹仅在第 k+dkk + d^k 段结束时揭示给学习器,其中延迟 dkd^k 既不相同也无界,且由无记忆对手选定。我们提出基于策略优化的新算法,在全信息反馈下取得 K+D\sqrt{K + D} 的近最优高概率后悔界,其中 KK 为段数,D=kdkD = \sum_{k} d^k 为总延迟。在 bandit 反馈下,我们证明在代价为随机时类似 K+D\sqrt{K + D} 的后悔界,而在一般情形下为 (K+D)2/3(K + D)^{2/3} 后悔界。我们是首个在具有延迟反馈的 MDP 这一重要设定中考虑后悔最小化的工作。

关键词

引用

@article{arxiv.2012.14843,
  title  = {Learning Adversarial Markov Decision Processes with Delayed Feedback},
  author = {Tal Lancewicki and Aviv Rosenberg and Yishay Mansour},
  journal= {arXiv preprint arXiv:2012.14843},
  year   = {2021}
}

备注

AAAI 2022