中文

基于强化学习的可变时域模型预测控制多机器人系统及通用按需避碰

机器人学 2023-08-15 v1

摘要

多机器人系统近年来因其从监视到协同载荷运输的广泛应用而非常流行。模型预测控制(MPC)因其预览能力及轻松处理约束的能力,成为多机器人控制的一种有前景的控制器。MPC 的性能在很大程度上取决于许多参数,其中预测时域是主要因素。将预测时域增加到某一限度之外会急剧增加计算成本。调参预测时域值可能非常耗时,且必须为每个任务重复调参过程。此外,与其在整个任务中使用固定时域,若能为每个机器人在各时间步采用不同预测时域,可在性能与计算成本间建立更好平衡。进一步,对于此类多机器人可变预测时域 MPC,按需避碰是关键需求。我们提出通用按需避碰(VODCA)策略以适配可变时域模型预测控制。我们还给出一种利用 Soft Actor-Critic(SAC)强化学习算法,将多机器人系统的预测时域学习为机器人状态函数的框架。结果针对不同多机器人任务进行了数值说明与验证。

关键词

引用

@article{arxiv.2308.07071,
  title  = {RL-based Variable Horizon Model Predictive Control of Multi-Robot Systems using Versatile On-Demand Collision Avoidance},
  author = {Shreyash Gupta and Abhinav Kumar and Niladri S. Tripathy and Suril V. Shah},
  journal= {arXiv preprint arXiv:2308.07071},
  year   = {2023}
}