中文

统计物理与强化学习之间的理论联系

机器学习 2021-09-30 v2 统计力学 人工智能 机器学习

摘要

在存在不确定性与随机动力学情况下的序贯决策,在强化学习(RL)与最优控制问题中产生了关于状态/动作轨迹的分布。这一观察导致了RL与概率图模型(PGMs)中推断之间的多种联系。在此我们探索这一关系的不同维度,借助统计物理的工具与抽象来考察强化学习。统计物理抽象中的核心对象是配分函数 Z\mathcal{Z} 的思想,这里我们由智能体在马尔可夫决策过程中可能采取的轨迹集合构造一个配分函数。尽管值函数与 QQ-函数可由此配分函数导出并经由平均能量解释,但 Z\mathcal{Z}-函数提供了一个拥有自身贝尔曼方程的对象,可作为替代动态规划方法的基础。此外,当MDP动力学为确定性时,Z\mathcal{Z} 的贝尔曼方程是线性的,允许直接求解,而传统值函数相关的非线性方程则无法实现。通过这些基于 Z\mathcal{Z} 的贝尔曼更新所学习的策略与类玻尔兹曼策略参数化紧密关联。除了像玻尔兹曼策略那样按期望累积奖励的指数比例采样动作外,这些策略还考虑熵,偏好可能产生多种结果的状态。

关键词

引用

@article{arxiv.1906.10228,
  title  = {A Theoretical Connection Between Statistical Physics and Reinforcement Learning},
  author = {Jad Rahme and Ryan P. Adams},
  journal= {arXiv preprint arXiv:1906.10228},
  year   = {2021}
}