中文

具有非遗忘型策略对手的在线马尔可夫决策过程

机器学习 2023-01-31 v3 人工智能 计算机科学与博弈论 多智能体系统

摘要

我们研究在线马尔可夫决策过程(OMDPs)中的一种新设定,其中损失函数由一个遵循无外部后悔算法的非遗忘型策略对手所选择。在此设定下,我们首先证明,现有针对遗忘型对手表现良好的算法 MDP-Expert 仍然适用,并可达到 O(Tlog(L)+τ2Tlog(A))\mathcal{O}(\sqrt{T \log(L)}+\tau^2\sqrt{ T \log(|A|)}) 的策略后悔界,其中 LL 为对手纯策略集的大小,A|A| 表示智能体动作空间的大小。考虑到现实博弈中纳什均衡(NE)的支撑规模较小,我们进一步提出一种新算法:MDP-Online Oracle Expert(MDP-OOE),其达到 O(Tlog(L)+τ2Tklog(k))\mathcal{O}(\sqrt{T\log(L)}+\tau^2\sqrt{ T k \log(k)}) 的策略后悔界,其中 kk 仅依赖于 NE 的支撑规模。MDP-OOE 利用了博弈论中双重预言机(Double Oracle)的关键优势,因此能够求解动作空间过大而难以处理的博弈。最后,为更好地理解无后悔方法的学习动态,在 OMDPs 中无外部后悔对手的相同设定下,我们引入一种算法,实现了到 NE 的末轮收敛结果。据我们所知,这是首个在 OMDPs 中得到末次迭代结果的工作。

关键词

引用

@article{arxiv.2110.03604,
  title  = {Online Markov Decision Processes with Non-oblivious Strategic Adversary},
  author = {Le Cong Dinh and David Henry Mguni and Long Tran-Thanh and Jun Wang and Yaodong Yang},
  journal= {arXiv preprint arXiv:2110.03604},
  year   = {2023}
}

备注

Accepted at Autonomous Agents and Multi-Agent Systems (2023)