中文

基于哈密顿正则常微分方程网络的模型基强化学习

机器学习 2022-11-03 v1

摘要

模型基强化学习在训练世界模型时通常面临高样本复杂度的问题,尤其在具有复杂动力学的环境中。为使通用物理环境的训练更高效,我们将哈密顿正则常微分方程引入学习过程,由此启发了一种新颖的神经常微分自编码器(NODA)模型。NODA 本质上可对物理世界建模,并能灵活施加哈密顿力学约束(例如物理方程的维度),从而进一步加速环境模型的训练。它可随之赋予 RL 智能体以少量样本进行鲁棒外推的能力,以及对物理合理性的保证。理论上,我们证明了在特定条件下 NODA 对多步转移误差和值误差具有一致界。大量实验表明,NODA 能以高样本效率有效学习环境动力学,从而可在早期阶段促进强化学习智能体。

关键词

引用

@article{arxiv.2211.00942,
  title  = {Model-based Reinforcement Learning with a Hamiltonian Canonical ODE Network},
  author = {Yao Feng and Yuhong Jiang and Hang Su and Dong Yan and Jun Zhu},
  journal= {arXiv preprint arXiv:2211.00942},
  year   = {2022}
}