中文

反应式智能体中的最优选择性注意

机器学习 2015-12-31 v1 信息论 math.IT

摘要

在部分可观测马尔可夫决策过程(POMDP)中,通过观测传递的关于隐藏状态的信息对智能体既有价值——使其能基于信息更充分的内部状态采取行动,也是一种“诅咒”——它使内部状态空间的规模和多样性爆炸式增长。应对此问题的一种尝试是关注反应式策略,即仅基于最近一次观测采取行动。然而,即便是反应式策略也可能对资源要求很高,智能体需要对观测中可用的部分信息给予选择性注意。在本报告中,我们提出反应式智能体中选择性注意的最小信息原理。我们进一步通过将 POMDP 中一般最优控制问题归约为具有复杂观测的反应式控制,来论证该方法的动机。最后,我们探讨了该优化过程新发现的周期倍化分岔现象。这需要周期性策略,并引发了关于最优控制中稳定性、周期性和混沌的更多问题。

关键词

引用

@article{arxiv.1512.08575,
  title  = {Optimal Selective Attention in Reactive Agents},
  author = {Roy Fox and Naftali Tishby},
  journal= {arXiv preprint arXiv:1512.08575},
  year   = {2015}
}