中文

面向部分可观测环境学习有限状态控制器

人工智能 2013-01-30 v1 系统与控制

摘要

反应式(无记忆)策略在完全可观测马尔可夫决策过程(MDP)中已足够,但对于部分可观测MDP的最优控制,通常需要某种形式的记忆。具有有限记忆的策略可表示为有限状态自动机。本文将Baird和Moore的VAPS算法扩展到学习通用有限状态自动机的问题上。由于该算法执行随机梯度下降,可证明其收敛到局部最优的有限状态控制器。我们给出了算法细节,并探讨了在何种条件下随机梯度下降优于精确梯度下降。最后,我们通过实证结果比较了随机梯度下降与精确梯度下降的性能,并展示了我们的算法能够从过去观测序列中提取有用信息,以弥补每个时间步上可观测性的不足。

关键词

引用

@article{arxiv.1301.6721,
  title  = {Learning Finite-State Controllers for Partially Observable Environments},
  author = {Nicolas Meuleau and Leonid Peshkin and Kee-Eung Kim and Leslie Pack Kaelbling},
  journal= {arXiv preprint arXiv:1301.6721},
  year   = {2013}
}

备注

Appears in Proceedings of the Fifteenth Conference on Uncertainty in Artificial Intelligence (UAI1999)