中文

在线MDP中的学习:处理通信情形是否有代价?

机器学习 2022-10-05 v2

摘要

一个显著的事实是,在专家问题和对抗性多臂老虎机问题中都可以达到相同的O(T)O(\sqrt{T})遗憾率,尽管在后一种情况下对动作数量的依赖更差。相比之下,已有研究表明,处理具有通信结构和bandit信息的在线MDP即使在确定性转移的情况下也会产生Ω(T2/3)\Omega(T^{2/3})的遗憾。这是处理通信结构的代价,还是因为我们同时拥有bandit反馈?在本文中,我们证明在完全信息下,即使存在通信结构,在线MDP仍然可以以O(T)O(\sqrt{T})的速率学习。我们首先通过为确定性转移情况提出一种高效的跟随扰动领导者(FPL)算法来证明这一点。然后我们将范围扩展到随机转移,首先给出一个低效的O(T)O(\sqrt{T})-遗憾算法(对动态施加了温和的附加条件)。然后我们展示了如何通过一种oracle高效的算法实现O(Tα)O\left(\sqrt{\frac{T}{\alpha}}\right)的遗憾率,但附加限制是起始状态分布在每个状态上的质量至少为α\alpha

关键词

引用

@article{arxiv.2111.02024,
  title  = {Learning in Online MDPs: Is there a Price for Handling the Communicating Case?},
  author = {Gautam Chandrasekaran and Ambuj Tewari},
  journal= {arXiv preprint arXiv:2111.02024},
  year   = {2022}
}

备注

19 pages