中文

具有延迟 Bandit 反馈的对抗 MDP 的近最优后悔界

机器学习 2023-01-24 v2

摘要

强化学习(RL)中的标准假设是智能体立即观测其动作反馈。然而在实践中,反馈常存在延迟。本文研究具有未知转移、对抗变化代价和无限制延迟 bandit 反馈的分幕马尔可夫决策过程(MDP)中的在线学习。更确切地说,智能体在第 kk 幕的反馈仅在第 k+dkk + d^k 幕结束时揭示,其中延迟 dkd^k 可随幕变化并由无记忆对手选择。我们提出了首个达到近最优 K+D\sqrt{K + D} 后悔界的算法,其中 KK 为幕数,D=k=1KdkD = \sum_{k=1}^K d^k 为总延迟,显著改进了已知最佳后悔界 (K+D)2/3(K + D)^{2/3}

关键词

引用

@article{arxiv.2201.13172,
  title  = {Near-Optimal Regret for Adversarial MDP with Delayed Bandit Feedback},
  author = {Tiancheng Jin and Tal Lancewicki and Haipeng Luo and Yishay Mansour and Aviv Rosenberg},
  journal= {arXiv preprint arXiv:2201.13172},
  year   = {2023}
}

备注

NeurIPS 2022