开放智能体系统中多智能体强化学习信用分配的挑战
机器学习
2025-11-03 v1 人工智能
多智能体系统
摘要
在快速发展的多智能体强化学习 (MARL) 领域,理解开放系统的动态至关重要。开放性在 MARL 中指代理器人口、任务以及系统内智能体类型的动态变化。具体而言,根据 (Eck 等 2023) [2] 的报告,开放性包含三种类型:即时智能体开放性,指智能体可随时进入或离开系统;任务开放性,指新任务出现,现有任务演化或消失;类型开放性,指智能体的能力和行为随时间变化。本报告提供概念和实证综述,重点考察开放性与信用分配问题 (CAP) 之间的相互作用。CAP 涉及确定 individual agents 对整体系统性能贡献的任务,在开放环境中变得日益复杂。传统信用分配方法往往假设智能体人口为静态、任务为固定且预定义,以及类型为稳态,这些假设在开放系统中不成立。我们首先进行概念分析,引入新的开放性子类别,详细说明代理人更替或任务取消如何破坏环境平稳性和固定团队组成的假设。随后,我们在开放环境中使用代表性时序和结构算法进行实证研究。结果表明,开放性直接导致信用误分配,表现为损失函数不稳定和显著的性能下降。
引用
@article{arxiv.2510.27659,
title = {Challenges in Credit Assignment for Multi-Agent Reinforcement Learning in Open Agent Systems},
author = {Alireza Saleh Abadi and Leen-Kiat Soh},
journal= {arXiv preprint arXiv:2510.27659},
year = {2025}
}