反应式智能体中的最优选择性注意
机器学习
2015-12-31 v1 信息论
math.IT
摘要
在部分可观测马尔可夫决策过程(POMDP)中,通过观测传递的关于隐藏状态的信息对智能体既有价值——使其能基于信息更充分的内部状态采取行动,也是一种“诅咒”——它使内部状态空间的规模和多样性爆炸式增长。应对此问题的一种尝试是关注反应式策略,即仅基于最近一次观测采取行动。然而,即便是反应式策略也可能对资源要求很高,智能体需要对观测中可用的部分信息给予选择性注意。在本报告中,我们提出反应式智能体中选择性注意的最小信息原理。我们进一步通过将 POMDP 中一般最优控制问题归约为具有复杂观测的反应式控制,来论证该方法的动机。最后,我们探讨了该优化过程新发现的周期倍化分岔现象。这需要周期性策略,并引发了关于最优控制中稳定性、周期性和混沌的更多问题。
引用
@article{arxiv.1512.08575,
title = {Optimal Selective Attention in Reactive Agents},
author = {Roy Fox and Naftali Tishby},
journal= {arXiv preprint arXiv:1512.08575},
year = {2015}
}