利用非线性轨迹优化加速基于模型的强化学习
机器学习
2025-06-04 v1 机器人学
摘要
本文通过将 Monte Carlo Probabilistic Inference for Learning Control (MC-PILCO) 这一基于模型的强化学习 (MBRL) 的最先进算法与迭代线性二次调节器 (iLQR) 这一适用于非线性系统的快速轨迹优化方法相结合,解决了 MC-PILCO 策略优化收敛缓慢的问题。所提出的方法 Exploration-Boosted MC-PILCO (EB-MC-PILCO) 利用 iLQR 生成信息丰富的探索性轨迹并初始化策略,显著减少了所需的优化步数。在 cart-pole 任务上的实验表明,与标准 MC-PILCO 相比,EB-MC-PILCO 加速了收敛,当两种方法均在四次试验中解决任务时,执行时间最多减少 。即使在 MC-PILCO 收敛迭代次数较少的情况下,EB-MC-PILCO 也在各次试验中保持 的成功率,同时更快地解决任务。
引用
@article{arxiv.2506.02767,
title = {Accelerating Model-Based Reinforcement Learning using Non-Linear Trajectory Optimization},
author = {Marco Calì and Giulio Giacomuzzo and Ruggero Carli and Alberto Dalla Libera},
journal= {arXiv preprint arXiv:2506.02767},
year = {2025}
}