中文

多智能体强化学习仓库机器人

人工智能 2025-12-10 v2 机器人学

摘要

我们present对多智能体强化学习(MARL)算法用于合作仓库机器人问题的比较研究。我们在Robotic Warehouse(RWARE)环境和自定义Unity 3D仿真环境中评估了QMIX和IPPO。我们的实验结果表明,QMIX的值分解显著优于独立学习方法(达到3.25平均回报,而高级IPPO仅为0.38),但需要 extensive 的超参数调优——特别是对于稀疏奖励发现,需要更长的 epsilon 退火(500万+步)。我们在Unity ML-Agents中成功部署,经过100万训练步骤后实现了稳定的包裹递送。虽然MARL对小规模部署(2-4个机器人)显示出前景,但仍存在显著的扩大规模挑战。代码和分析: https://pallman14.github.io/MARL-QMIX-Warehouse-Robots/

关键词

引用

@article{arxiv.2512.04463,
  title  = {MARL Warehouse Robots},
  author = {Price Allman and Lian Thang and Dre Simmons and Salmon Riaz},
  journal= {arXiv preprint arXiv:2512.04463},
  year   = {2025}
}

备注

5 pages.Project documentation: https://pallman14.github.io/MARL-QMIX-Warehouse-Robots/