用于深度强化学习的任务无关动力学先验
机器学习
2019-07-12 v4 人工智能
机器学习
摘要
尽管基于模型的深度强化学习(RL)在样本效率和泛化方面大有前景,但学习准确的动力学模型通常具有挑战性,且需要与环境的大量交互。广泛的领域具有共享共同基础的动力学,如经典力学定律,现有算法很少利用这些。事实上,人类持续获取并使用此类动力学先验,以轻松适应在新环境中的操作。在这项工作中,我们提出一种从视频中学习任务无关动力学先验并将其纳入 RL 智能体的方法。我们的方法包括在任务无关物理视频上预训练帧预测器,以初始化未见目标环境的动力学模型(并微调它们)。我们的帧预测架构 SpatialNet 专门设计用于捕捉局部物理现象和交互。我们的方法允许更快的策略学习并收敛到更好的策略,在多个不同环境中优于竞争方法。我们还证明,纳入该先验可实现更有效的跨环境迁移。
引用
@article{arxiv.1905.04819,
title = {Task-Agnostic Dynamics Priors for Deep Reinforcement Learning},
author = {Yilun Du and Karthik Narasimhan},
journal= {arXiv preprint arXiv:1905.04819},
year = {2019}
}
备注
ICML 2019