中文

机器人学中的无感知马尔可夫决策过程

机器人学 2020-05-22 v1 人工智能

摘要

我们利用连续 MDP 以及在连续时间间隔上发生的动作, 形式化机器人学与自动控制的决策问题。随后我们使用越来越细的离散化来近似连续 MDP。这样做产生一系列系统, 每个系统具有极大的动作空间, 尽管只有少数动作是“有趣的”。我们可将决策者视为不知道哪些动作是“有趣的”。我们可以使用 MDPU(带无感知的 MDP)来建模, 其动作空间小得多。如我们所展示的, MDPU 可用作机器人问题中学习任务的通用框架。我们证明了在 MDPU 中为连续任务学习近最优策略的困难性结果。我们将这些思想应用于让仿人机器人自主学会行走的问题。

关键词

引用

@article{arxiv.2005.10381,
  title  = {MDPs with Unawareness in Robotics},
  author = {Nan Rong and Joseph Y. Halpern and Ashutosh Saxena},
  journal= {arXiv preprint arXiv:2005.10381},
  year   = {2020}
}

备注

Appears in Proceedings of the 32nd Conference on Uncertainty in AI (UAI 2016), 2016