具有延迟 Bandit 反馈的对抗 MDP 的近最优后悔界
机器学习
2023-01-24 v2
摘要
强化学习(RL)中的标准假设是智能体立即观测其动作反馈。然而在实践中,反馈常存在延迟。本文研究具有未知转移、对抗变化代价和无限制延迟 bandit 反馈的分幕马尔可夫决策过程(MDP)中的在线学习。更确切地说,智能体在第 幕的反馈仅在第 幕结束时揭示,其中延迟 可随幕变化并由无记忆对手选择。我们提出了首个达到近最优 后悔界的算法,其中 为幕数, 为总延迟,显著改进了已知最佳后悔界 。
引用
@article{arxiv.2201.13172,
title = {Near-Optimal Regret for Adversarial MDP with Delayed Bandit Feedback},
author = {Tiancheng Jin and Tal Lancewicki and Haipeng Luo and Yishay Mansour and Aviv Rosenberg},
journal= {arXiv preprint arXiv:2201.13172},
year = {2023}
}
备注
NeurIPS 2022