基于层次策略梯度的多智能体非黏性目标驱动式放牧控制
机器学习
2025-04-04 v1 人工智能
多智能体系统
系统与控制
系统与控制
机器学习
摘要
我们提出了一种基于策略梯度方法的多智能体非黏性目标放牧控制的去中心化强化学习解决方案。我们的体系结构将目标选择与目标驱动集成通过 Proximal Policy Optimization 实现,克服了前序 Deep Q-Network 方法的离散动作限制,实现更平滑的智能体轨迹。该模型无框架有效地解决了放牧问题,无需先验动力学知识。实验表明,我们的方法在增加目标数量和受限感知能力的情况下展现出有效性和可扩展性。
引用
@article{arxiv.2504.02479,
title = {Hierarchical Policy-Gradient Reinforcement Learning for Multi-Agent Shepherding Control of Non-Cohesive Targets},
author = {Stefano Covone and Italo Napolitano and Francesco De Lellis and Mario di Bernardo},
journal= {arXiv preprint arXiv:2504.02479},
year = {2025}
}