中文

马尔可夫决策过程中因果信息与价值的统一贝尔曼方程

系统与控制 2018-06-06 v2

摘要

人工智能体与其环境之间的交互是双向的。智能体从环境中提取相关信息,并通过其动作反过来影响环境,以累积高期望奖励。标准强化学习 (RL) 处理期望奖励最大化问题。然而,始终存在信息论层面的限制约束着期望奖励,而标准 RL 并未恰当考虑这些限制。在这项工作中,我们考虑带有信息论限制的 RL 目标。我们首次为环境与智能体之间的因果信息推导出一个贝尔曼型递归方程,并将其合理地与价值函数的贝尔曼递归相结合。该统一方程用于探索人工智能体在无限时间范围内的典型行为。

关键词

引用

@article{arxiv.1703.01585,
  title  = {A Unified Bellman Equation for Causal Information and Value in Markov Decision Processes},
  author = {Stas Tiomkin and Naftali Tishby},
  journal= {arXiv preprint arXiv:1703.01585},
  year   = {2018}
}

备注

9 pages, 4 figures