基于 KL 正则化的自适应先验规划学习框架
机器学习
2026-05-22 v2 人工智能
机器人学
摘要
有效探索仍是基于模型的强化学习(MBRL)中的核心挑战,尤其是在高维连续控制任务中,样本效率至关重要。近期研究的一个重要方向是利用学习到的策略作为 Model-Predictive Path Integral(MPPI)规划的proposal分布。初始方法会独立于规划分布来更新采样策略,通常通过确定性策略梯度和熵正则化来最大化学习到的价值函数。然而,由于训练期间遇到的状态依赖于 MPPI 规划器,与规划器对齐采样策略可提高价值估计的准确性和长期性能。为此,近期方法通过最小化KL散度来更新采样策略,或在策略更新中引入由规划器引导的正则化。在本工作中,我们在统一框架下引入了策略优化-模型预测控制(PO-MPC),这是一族集成规划器动作分布作为策略优化中先验的 KL 正则化 MBRL 方法。通过对齐学习策略与规划器行为,PO-MPC 允许在收益最大化和KL散度最小化之间更灵活地进行权衡。我们阐明了如何将先前方法作为该族的特例,探索了此前未研究的变体。我们的实验表明,这些扩展配置均带来了显著的性能提升,推动了 MPPI-based RL 领域的技术进步。
引用
@article{arxiv.2510.04280,
title = {A KL-regularization Framework for Learning to Plan with Adaptive Priors},
author = {Álvaro Serra-Gomez and Daniel Jarne Ornia and Dhruva Tirumala and Thomas Moerland},
journal= {arXiv preprint arXiv:2510.04280},
year = {2026}
}
备注
Published at ICML2026