基于局部信息聚合的机器人群体动态任务分配多智能体强化学习
人工智能
2024-12-02 v1 多智能体系统
机器人学
摘要
在本文中,我们探索如何优化机器人群体在动态环境中的任务分配,强调制定鲁棒、灵活且可扩展的机器人协作策略的必要性。我们引入一种新型框架,使用去部分可观测马尔可夫决策过程(Dec_POMDP),专为分布式机器人群体网络设计。我们方法的核心是局部信息聚合多智能体深度确定性策略梯度(Local Information Aggregation Multi-Agent Deep Deterministic Policy Gradient, LIA_MADDPG)算法,将集中训练与分布式执行相结合(CTDE)。在集中训练阶段,精心设计的局部信息聚合(LIA)模块用于收集来自相邻机器人的关键数据,增强决策效率。在分布式执行阶段,提出一种策略改进方法,用于基于变化且部分可观测环境条件动态调整任务分配。我们的经验评估表明,LIA模块可无缝集成到各种CTDE-based MARL方法中,显著提升其性能。此外,通过将LIA_MADDPG与六种常规强化学习算法和一种启发式算法进行比较,我们展示了其卓越的可扩展性、快速适应环境变化的能力,以及维持稳定性和收敛速度的能力。这些结果凸显了LIA_MADDPG的优异性能及其潜在显著性地提高机器人群体动态任务分配能力的前景,通过增强局部协作和自适应策略执行。
引用
@article{arxiv.2411.19526,
title = {A Local Information Aggregation based Multi-Agent Reinforcement Learning for Robot Swarm Dynamic Task Allocation},
author = {Yang Lv and Jinlong Lei and Peng Yi},
journal= {arXiv preprint arXiv:2411.19526},
year = {2024}
}