中文

深度鲁棒卡尔曼滤波

人工智能 2017-03-08 v1 机器学习 机器学习

摘要

鲁棒马尔可夫决策过程(Robust Markov Decision Process, RMDP)是一种考虑动态系统参数不确定性的序贯决策模型。这种不确定性给学习最优策略带来困难,尤其对于具有大状态空间的环境。我们提出两种算法,RTD-DQN与Deep-RoK,用于使用深度神经网络等非线性逼近方案求解大规模RMDP。RTD-DQN算法将鲁棒贝尔曼时序差分误差纳入鲁棒损失函数,从而为智能体产生鲁棒策略。Deep-RoK算法是一种基于扩展卡尔曼滤波(Extended Kalman Filter, EKF)的鲁棒贝叶斯方法,它同时考虑了逼近值函数权重的不确定性与转移概率的不确定性,提升了智能体的鲁棒性。我们给出了方法的理论结果,并在连续状态域上测试了所提算法。

关键词

引用

@article{arxiv.1703.02310,
  title  = {Deep Robust Kalman Filter},
  author = {Shirli Di-Castro Shashua and Shie Mannor},
  journal= {arXiv preprint arXiv:1703.02310},
  year   = {2017}
}