再生核 Hilbert 空间中的连续时间值函数逼近
最优化与控制
2018-12-03 v3 人工智能
摘要
受强化学习(RL)在 AlphaGo 和 Atari 游戏等离散时间任务中成功的推动,近来对使用 RL 进行物理系统连续时间控制(参见 OpenAI Gym 和 DeepMind Control Suite 中的许多挑战性任务)的兴趣激增。由于时间离散化易于产生误差,从方法论上更直接处理连续时间下的系统动力学更为可取。然而,极少有连续时间 RL 技术存在,且它们缺乏值函数逼近的灵活性。在本文中,我们提出了一种基于模型的再生核 Hilbert 空间中连续时间值函数逼近的新框架。所得框架非常灵活,可容纳任何基于核的方法,如高斯过程和核自适应滤波器,并允许我们在无需关于环境或应使用何种基函数的先验知识的情况下处理不确定性和非平稳性。我们通过实验证明了所提框架的有效性。
引用
@article{arxiv.1806.02985,
title = {Continuous-time Value Function Approximation in Reproducing Kernel Hilbert Spaces},
author = {Motoya Ohnishi and Masahiro Yukawa and Mikael Johansson and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1806.02985},
year = {2018}
}
备注
NeurIPS 2018 - Advances in Neural Information Processing Systems (with the supplementary document)