中文

基于神经物理信息偏微分方程的分布离线连续时间强化学习(SciPhy RL for DOCTR-L)

机器学习 2021-04-05 v1 人工智能 计算物理 计算金融

摘要

本文研究用于高维最优控制的带随机策略的分布离线连续时间强化学习(DOCTR-L)。经典 Hamilton-Jacobi-Bellman(HJB)方程的软分布版本由一个半线性偏微分方程(PDE)给出。该“软 HJB 方程”可从离线数据学习,而无需假设数据对应于先前的优化或近最优策略。软 HJB 方程的数据驱动求解使用了科学机器学习(SciML)领域中发展的神经 PDE 与物理信息神经网络方法。所建议的方法被称为“SciPhy RL”,从而将 DOCTR-L 简化为从数据求解神经 PDE。我们的算法称为 Deep DOCTR-L,通过将离线高维数据归约为监督学习,一步将其转换为最优策略,而非依赖值迭代或策略迭代方法。该方法能够对所得策略的质量控制进行可计算评估,包括其期望回报及关于其价值的不确定性。

关键词

引用

@article{arxiv.2104.01040,
  title  = {Distributional Offline Continuous-Time Reinforcement Learning with Neural Physics-Informed PDEs (SciPhy RL for DOCTR-L)},
  author = {Igor Halperin},
  journal= {arXiv preprint arXiv:2104.01040},
  year   = {2021}
}

备注

24 pages, 5 figures