中文

软机器人机臂集中式与分布式强化学习控制的量化比较

机器人学 2026-03-03 v2

摘要

本文对比了集中式和分布式多智能体强化学习(MARL)架构在以 Cosserat rod 模型的软机器人臂控制中的性能。使用 PyElastica 和 OpenAI Gym 接口,我们在相同预算下训练全局的 Proximal Policy Optimisation(PPO)控制器和 Multi-Agent PPO(MAPPO)。两种方法均基于臂具有 n 个受控段。该研究系统性地变化 n 的数值,并评估臂在三个情景下到达固定目标的性能:默认基线条件、外部干扰恢复以及执行器失效适应。用于评估的量化指标包括平均动作幅度、平均最终距离、平均剧集长度和成功率。结果表明,当受控段数 n ≤ 4 时,分布式策略没有显著优势。在简单系统中,当 n ≤ 2 时,集中式策略优于分布式策略。当 n 增加到 4 < n ≤ 12 时,分布式策略显示出高样本效率。在这些系统中,分布式策略促进更高的成功率、韧性和鲁棒性,同时在相同样本大小下实现更快的收敛。然而,集中式策略在训练期间实现了更高的时间效率,因为训练相同规模样本所需时间更少。这些发现突显了集中式与分布式策略在基于强化学习的软机器人控制中的权衡,为未来软棒状操作臂的仿真到现实转移提供了可操作的设计指导。

关键词

引用

@article{arxiv.2511.02192,
  title  = {A Quantitative Comparison of Centralised and Distributed Reinforcement Learning-Based Control for Soft Robotic Arms},
  author = {Linxin Hou and Qirui Wu and Zhihang Qin and Neil Banerjee and Yongxin Guo and Cecilia Laschi},
  journal= {arXiv preprint arXiv:2511.02192},
  year   = {2026}
}

备注

7 pages, 4 figures, 2 tables, accepted by RoboSoft 2026