中文

非对称信息随机博弈中具有一阶信念的推测在线学习

计算机科学与博弈论 2024-08-20 v4 机器学习 系统与控制 系统与控制

摘要

非对称信息随机博弈出现在许多复杂的社会技术系统中,例如网络物理系统和IT基础设施。现有的非对称信息随机博弈计算方法主要是离线的,无法适应均衡偏差。此外,当前方法限于特定的信息结构以避免信念层次。考虑到这些局限性,我们提出了推测在线学习,一种在非对称信息随机博弈中通用信息结构下的在线学习方法。推测在线学习使用预测器-执行器-评论家架构,其中主观预测用于在展望范围内推测对手的策略,贝叶斯学习用于校准推测。为了基于信息反馈适应非平稳环境中的策略,推测在线学习使用带有成本函数近似的在线展开(执行器-评论家)。我们证明了推测在线学习产生的推测在松弛贝叶斯一致性的意义下渐近地与信息反馈一致。我们还证明了推测在线学习诱导的经验策略分布收敛于Berk-Nash均衡,这是一种表征主观性下理性的解概念。来自入侵响应用例的实验结果表明,在对抗非平稳攻击时,推测在线学习比最先进的强化学习方法具有更快的收敛速度。

关键词

引用

@article{arxiv.2402.18781,
  title  = {Conjectural Online Learning with First-order Beliefs in Asymmetric Information Stochastic Games},
  author = {Tao Li and Kim Hammar and Rolf Stadler and Quanyan Zhu},
  journal= {arXiv preprint arXiv:2402.18781},
  year   = {2024}
}

备注

Accepted to the 63rd IEEE Conference on Decision and Control, Special Session on Networks, Games and Learning