不同iable 信息增强的模型基强化学习
机器学习
2025-03-04 v1 机器人学
摘要
不同iable 环境为通过提供丰富的不同iable 信息促进梯度方法学习控制策略开辟了新可能。与主流的模型无监督强化学习方法相比,模型基强化学习 (MBRL) 方法具有潜力有效利用不同iable 信息来恢复 underlying 物理动力学。然而,这提出了两个主要挑战:1) 有效利用不同iable 信息构建更精确的动态预测模型;2) 提高策略训练的稳定性。本文提出了一种 Differentiable Information Enhanced MBRL 方法,即 MB-MIX,以应对这两个挑战。首先,我们采用 Sobolev 模型训练方法对错误的模型梯度输出进行惩罚,从而增强预测精度,构建更精确、忠实于系统动力学的模型。其次,我们引入截断学习窗口的混合长度,以减少策略梯度估计的方差,从而提高策略学习的稳定性。为验证该方法在不同iable 环境中的有效性,我们提供了理论分析和实证结果。值得注意的是,我们的方法在涉及可控刚性机器人的多个具有挑战性的任务中(如人形机器人的运动控制和可变形物体操纵)均优于先前的模型基和模型无监督方法。
引用
@article{arxiv.2503.01178,
title = {Differentiable Information Enhanced Model-Based Reinforcement Learning},
author = {Xiaoyuan Zhang and Xinyan Cai and Bo Liu and Weidong Huang and Song-Chun Zhu and Siyuan Qi and Yaodong Yang},
journal= {arXiv preprint arXiv:2503.01178},
year = {2025}
}
备注
Accepted by AAAI 2025