中文

对抗式马尔可夫决策过程中的在线凸优化

机器学习 2019-05-21 v1 人工智能 机器学习

摘要

我们考虑 episodic 无环马尔可夫决策过程(MDP)中的在线学习,其中损失函数可在各 episode 之间任意变化,且转移函数不为学习器所知。我们给出 O~(LXAT)\tilde{O}(L|X|\sqrt{|A|T}) 的悔界,其中 TT 为 episode 数,XX 为状态空间,AA 为动作空间,LL 为每个 episode 的长度。我们的在线算法采用熵正则化方法实现,这使得可将原始对抗式 MDP 模型扩展到处理凸性能准则(聚合单个 episode 损失的不同方式),并改进了先前的悔界。

关键词

引用

@article{arxiv.1905.07773,
  title  = {Online Convex Optimization in Adversarial Markov Decision Processes},
  author = {Aviv Rosenberg and Yishay Mansour},
  journal= {arXiv preprint arXiv:1905.07773},
  year   = {2019}
}