Multi-Agent Inverse Reinforcement Learning for Identifying Pareto-Efficient Coordination -- A Distributionally Robust Approach
系统与控制
2025-09-12 v1 系统与控制
信号处理
摘要
多智能体逆强化学习 (IRL) 旨在识别多智能体系统中的 Pareto 有效行为,并重构 individual agents 的效用函数。为了检测 UAV 之间的协调,我们如何构建一个给定多智能体系统决策噪声测量数据的统计检测器来识别 Pareto 有效协调?本文通过推导多智能体系统动力学数据集是否与 Pareto 有效协调一致的必要充分条件,提供算法来恢复与系统动力学一致的效用函数。我们推导了用于从噪声系统测量中确定 Pareto 有效协调的最优统计检测器,最小化 Type-I 统计检测误差。然后,我们提供一个效用估计算法,通过最小化以经验观察为中心的统计模糊集合中最坏情况估计误差来实现分布鲁棒 IRL,这在对抗性战略互动中至关重要。我们在 UAV 多个体之间检测 Pareto 有效协调的噪声测量雷达记录的详细示例中展示了这些结果。随后,我们以分布鲁棒的方式重构 UAV 的效用函数。
引用
@article{arxiv.2509.08956,
title = {Multi-Agent Inverse Reinforcement Learning for Identifying Pareto-Efficient Coordination -- A Distributionally Robust Approach},
author = {Luke Snow and Vikram Krishnamurthy},
journal= {arXiv preprint arXiv:2509.08956},
year = {2025}
}