中文

基于概率准则的非平稳非零和马尔可夫博弈

机器学习 2025-05-16 v1 人工智能

摘要

本文讨论的是在概率准则下进行的N人非零和离散时间马尔可夫博弈,其中转移概率和奖励函数允许随时间变化。与基于期望奖励准则的现有工作不同,我们关注的是最大化累计奖励直至到达任何目标集合的第一到达时间的概率,这代表了玩家收入的可靠性。在轻柔条件下,我们通过发展概率准则的比较定理,证明了历史依赖策略的纳什均衡的存在性。此外,我们提供了一个高效计算 ϵ\epsilon -纳什均衡的算法。最后,我们通过一个非平稳能源管理模型和数值实验来说明我们的主要结果。

关键词

引用

@article{arxiv.2505.10128,
  title  = {Robust Federated Learning on Edge Devices with Domain Heterogeneity},
  author = {Huy Q. Le and Latif U. Khan and Choong Seon Hong},
  journal= {arXiv preprint arXiv:2505.10128},
  year   = {2025}
}

备注

IWCMC 2025