中文

利用非线性轨迹优化加速基于模型的强化学习

机器学习 2025-06-04 v1 机器人学

摘要

本文通过将 Monte Carlo Probabilistic Inference for Learning Control (MC-PILCO) 这一基于模型的强化学习 (MBRL) 的最先进算法与迭代线性二次调节器 (iLQR) 这一适用于非线性系统的快速轨迹优化方法相结合,解决了 MC-PILCO 策略优化收敛缓慢的问题。所提出的方法 Exploration-Boosted MC-PILCO (EB-MC-PILCO) 利用 iLQR 生成信息丰富的探索性轨迹并初始化策略,显著减少了所需的优化步数。在 cart-pole 任务上的实验表明,与标准 MC-PILCO 相比,EB-MC-PILCO 加速了收敛,当两种方法均在四次试验中解决任务时,执行时间最多减少 45.9%\bm{45.9\%}。即使在 MC-PILCO 收敛迭代次数较少的情况下,EB-MC-PILCO 也在各次试验中保持 100%\bm{100\%} 的成功率,同时更快地解决任务。

关键词

引用

@article{arxiv.2506.02767,
  title  = {Accelerating Model-Based Reinforcement Learning using Non-Linear Trajectory Optimization},
  author = {Marco Calì and Giulio Giacomuzzo and Ruggero Carli and Alberto Dalla Libera},
  journal= {arXiv preprint arXiv:2506.02767},
  year   = {2025}
}