中文

概率性智能体掉线下的多智能体 MDP 无模型学习与最优策略设计

系统与控制 2024-09-24 v2 人工智能 机器学习 系统与控制

摘要

本研究考察一个可能经历智能体掉线的多智能体马尔可夫决策过程(MDP),以及基于掉线前系统的控制与采样为掉线后系统计算策略的问题。中央规划器的目标是在给定智能体掉线概率先验知识的情况下,找到最大化期望系统价值的最优策略。对于具有特定转移独立性与奖励可分离结构的 MDP,我们假设从系统中移除智能体会形成一个由剩余智能体组成的新 MDP,其具有新的状态与动作空间、边缘化被移除智能体的转移动态,以及独立于被移除智能体的奖励。我们首先证明,在这些假设下,期望掉线后系统的价值可由单一 MDP 表示;该“鲁棒 MDP”无需评估系统的全部 2N2^N 种实现,其中 N 表示智能体数量。更重要的是,在无模型背景下,表明鲁棒 MDP 价值可用掉线前系统生成的样本估计,意味着可在掉线发生前找到鲁棒策略。利用这一事实,我们提出一种策略重要性采样(IS)例程,其在以良好掉线前策略控制系统时对掉线场景进行策略评估。该策略 IS 例程为鲁棒 MDP 和特定掉线后系统实现产生价值估计,并以指数置信界为依据。最后,在仿真中验证了该方法的效用,展示了智能体掉线的结构特性如何帮助控制器在掉线发生前找到良好的掉线后策略。

关键词

引用

@article{arxiv.2304.12458,
  title  = {Model-Free Learning and Optimal Policy Design in Multi-Agent MDPs Under Probabilistic Agent Dropout},
  author = {Carmel Fiscko and Soummya Kar and Bruno Sinopoli},
  journal= {arXiv preprint arXiv:2304.12458},
  year   = {2024}
}

备注

22 pages, 5 figures