学习有限状态马尔可夫链的拟平稳分布
机器学习
2022-09-14 v2
摘要
我们提出一种强化学习(RL)方法来计算拟平稳分布的表达式。基于拟平稳分布的不动点表述,我们最小化由候选分布与真实目标分布诱导的两个马尔可夫路径分布的KL散度。为通过梯度下降解决这一具挑战性的最小化问题,我们引入奖励与值函数并应用强化学习技术。我们推导了相应的策略梯度定理,并设计了演员-评论家(actor-critic)算法来学习最优解与值函数。我们测试了有限状态马尔可夫链的数值例子以展示这一新方法。
引用
@article{arxiv.2111.11213,
title = {Learn Quasi-stationary Distributions of Finite State Markov Chain},
author = {Zhiqiang Cai and Ling Lin and Xiang Zhou},
journal= {arXiv preprint arXiv:2111.11213},
year = {2022}
}
备注
18 pages, 5 figures