在线MDP中的学习:处理通信情形是否有代价?
机器学习
2022-10-05 v2
摘要
一个显著的事实是,在专家问题和对抗性多臂老虎机问题中都可以达到相同的遗憾率,尽管在后一种情况下对动作数量的依赖更差。相比之下,已有研究表明,处理具有通信结构和bandit信息的在线MDP即使在确定性转移的情况下也会产生的遗憾。这是处理通信结构的代价,还是因为我们同时拥有bandit反馈?在本文中,我们证明在完全信息下,即使存在通信结构,在线MDP仍然可以以的速率学习。我们首先通过为确定性转移情况提出一种高效的跟随扰动领导者(FPL)算法来证明这一点。然后我们将范围扩展到随机转移,首先给出一个低效的-遗憾算法(对动态施加了温和的附加条件)。然后我们展示了如何通过一种oracle高效的算法实现的遗憾率,但附加限制是起始状态分布在每个状态上的质量至少为。
引用
@article{arxiv.2111.02024,
title = {Learning in Online MDPs: Is there a Price for Handling the Communicating Case?},
author = {Gautam Chandrasekaran and Ambuj Tewari},
journal= {arXiv preprint arXiv:2111.02024},
year = {2022}
}
备注
19 pages