利用基于模型的强化学习学习不完全受控系统的全局控制
机器人学
2025-04-10 v1 人工智能
机器学习
摘要
本短文描述了我们为第三个"AI奥运会"解决方案的提出,该竞赛于ICRA 2025期间举行。我们采用了蒙特卡洛概率推断控制学习(Monte-Carlo Probabilistic Inference for Learning Control, MC-PILCO),这是一种在各种低维机器人任务中表现卓越的数据效率的MBRL算法,包括cart-pole、ball与盘和Furuta摆锤系统。MC-PILCO通过使用互动数据优化系统动力学模型,使通过仿真来实现策略细化,而非直接优化系统数据。这一方法在实际系统中效果显著,数据效率优于基于模型的(MF)替代方案。值得注意的是,MC-PILCO在前两个赛事 editions中获胜,证明了其在模拟和实际环境中的鲁棒性。除了简要回顾该算法外,我们讨论了MC-PILCO在此类任务中最关键的实施方面:为pendubot和acrobot系统学习全局策略。
引用
@article{arxiv.2504.06721,
title = {Learning global control of underactuated systems with Model-Based Reinforcement Learning},
author = {Niccolò Turcato and Marco Calì and Alberto Dalla Libera and Giulio Giacomuzzo and Ruggero Carli and Diego Romeres},
journal= {arXiv preprint arXiv:2504.06721},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2409.05811