基于影响范围的多主体强化学习信用分配与高效探索
机器学习
2025-05-14 v1
摘要
在稀疏奖励情境中训练合作代理器具有挑战性。没有明确的反馈来指导每个步骤中的动作,先前的方法在稀疏奖励设置下难以进行精确的信用分配以及有效的探索。在本文中,我们提出了一种处理这两种信用分配和探索问题的新方法。相应地,我们提出了一种算法,通过计算单个代理能够影响状态维度/属性的特定值的影响范围(ISA)来计算代理的影响范围。随后,将代理动作与状态属性之间的相互依赖性用于计算信用分配以及为每个单个代理 delimit 探索空间。我们在各种稀疏奖励多主体情境中对ISA进行了评估。结果表明,我们的方法在SOTA基线上显著优于。
引用
@article{arxiv.2505.08630,
title = {Credit Assignment and Efficient Exploration based on Influence Scope in Multi-agent Reinforcement Learning},
author = {Shuai Han and Mehdi Dastani and Shihan Wang},
journal= {arXiv preprint arXiv:2505.08630},
year = {2025}
}