面向真实世界离线基于模型强化学习的可微物理模型
机器人学
2020-11-04 v1 机器学习
摘要
基于模型的强化学习(MBRL)的一个局限是对所学模型误差的利用。黑盒模型可以高保真地拟合复杂动力学,但其行为在数据分布之外是未定义的。基于物理的模型由于其所依据结构的普遍有效性而更擅长外推,但由于未建模现象的存在而在真实世界中欠拟合。在这项工作中,我们通过实验证明,在离线基于模型的强化学习设定下,如果机械结构已知,基于物理的模型相比于高容量函数逼近器可能是有益的。基于物理的模型可以仅使用 4 分钟的采样数据,通过离线 MBRL 在物理机械臂上学会执行球杯任务(BiC)。我们发现黑盒模型始终为 BiC 产生不可行的策略,因为所有预测轨迹都发散到物理上不可能的状态,尽管其可访问的数据多于基于物理的模型。此外,我们利用端到端自动微分,将物理参数辨识的方法从完整约束多体系统建模推广到具有非完整动力学的系统。视频:https://sites.google.com/view/ball-in-a-cup-in-4-minutes/
引用
@article{arxiv.2011.01734,
title = {Differentiable Physics Models for Real-world Offline Model-based Reinforcement Learning},
author = {Michael Lutter and Johannes Silberbauer and Joe Watson and Jan Peters},
journal= {arXiv preprint arXiv:2011.01734},
year = {2020}
}