机器人学中的无感知马尔可夫决策过程
机器人学
2020-05-22 v1 人工智能
摘要
我们利用连续 MDP 以及在连续时间间隔上发生的动作, 形式化机器人学与自动控制的决策问题。随后我们使用越来越细的离散化来近似连续 MDP。这样做产生一系列系统, 每个系统具有极大的动作空间, 尽管只有少数动作是“有趣的”。我们可将决策者视为不知道哪些动作是“有趣的”。我们可以使用 MDPU(带无感知的 MDP)来建模, 其动作空间小得多。如我们所展示的, MDPU 可用作机器人问题中学习任务的通用框架。我们证明了在 MDPU 中为连续任务学习近最优策略的困难性结果。我们将这些思想应用于让仿人机器人自主学会行走的问题。
引用
@article{arxiv.2005.10381,
title = {MDPs with Unawareness in Robotics},
author = {Nan Rong and Joseph Y. Halpern and Ashutosh Saxena},
journal= {arXiv preprint arXiv:2005.10381},
year = {2020}
}
备注
Appears in Proceedings of the 32nd Conference on Uncertainty in AI (UAI 2016), 2016