基于因子化 Dec-MDP 的双曲 PDE 数值方法多智能体学习
机器学习
2022-10-17 v1 人工智能
多智能体系统
摘要
因子化去中心化马尔可夫决策过程(Dec-MDP)是用于建模多智能体系统中序贯决策问题的框架。本文将双曲偏微分方程(PDE)数值方法的学习,特别是加权本质无振荡(WENO)格式,形式化为因子化 Dec-MDP 问题。我们展示了不同的奖励公式会导致强化学习(RL)或行为克隆,并且在 RL 公式下可通过策略梯度算法为所有智能体学习同质策略。由于训练后的智能体仅基于其局部观测行动,该多智能体系统可用作双曲 PDE 的通用数值方法,并泛化到不同的空间离散化、回合长度、维度乃至方程类型。
引用
@article{arxiv.2205.15716,
title = {Multi-Agent Learning of Numerical Methods for Hyperbolic PDEs with Factored Dec-MDP},
author = {Yiwei Fu and Dheeraj S. K. Kapilavai and Elliot Way},
journal= {arXiv preprint arXiv:2205.15716},
year = {2022}
}
备注
Submitted to 20th International Conference on Practical Applications of Agents and Multi-Agent Systems (PAAMS 2022)