模块化可重构月球机器人多模态去中心化强化学习
机器人学
2025-10-24 v1 多智能体系统
摘要
模块化可重构机器人适合任务特定的太空操作,但形态组合的增长阻碍了统一控制。我们提出一种去中心化强化学习(Dec-RL)方案,每个模块学习其自身策略:轮子模块使用 Soft Actor-Critic(SAC)进行 locomotion,7 自由度肢体使用 Proximal Policy Optimization(PPO)进行驾驶和操作,实现对未见配置的零样本泛化。在仿真中,驾驶策略实现了所需角度与实际角度之间平均绝对误差为 3.63{\deg};操作策略在目标偏移准则下达到 84.6% 的成功率;轮子策略将平均电机扭矩降低了 95.4%,同时保持 99.6% 的成功率。月球模拟实验验证了零样本集成,实现了自主 locomotion、驾驶和初步对齐以进行重构。系统在策略执行的同步、并行和顺序模式之间平滑过渡,无空闲状态或控制冲突,表明该方法对模块化月球机器人具有可扩展、可复用且稳健的特性。
引用
@article{arxiv.2510.20347,
title = {Multi-Modal Decentralized Reinforcement Learning for Modular Reconfigurable Lunar Robots},
author = {Ashutosh Mishra and Shreya Santra and Elian Neppel and Edoardo M. Rossi Lombardi and Shamistan Karimov and Kentaro Uno and Kazuya Yoshida},
journal= {arXiv preprint arXiv:2510.20347},
year = {2025}
}
备注
Accepted in IEEE iSpaRo 2025. Awaiting Publication