中文

有限空间上强化链的经验测度大偏差

概率论 2022-05-20 v1 最优化与控制

摘要

AA 为有限状态空间 Δo={1,,d}\Delta^o =\{1, \ldots , d\} 上的转移概率核,使得对所有 x,yΔox,y \in \Delta^oA(x,y)>0A(x,y)>0。考虑由 Δo\Delta^o 值随机变量序列 {Xn,  nN0}\{X_n, \; n \in \mathbb{N}_0\} 给出的强化链,按如下递归定义:Ln=1ni=0n1δXi,    P(Xn+1X0,,Xn)=LnA().L^n = \frac{1}{n}\sum_{i=0}^{n-1} \delta_{X_i}, \;\; P(X_{n+1} \in \cdot \mid X_0, \ldots, X_n) = L^n A(\cdot). 我们建立了 {Ln}\{L^n\} 的大偏差原理。其速率函数呈现出与转移核为 AA 的马尔可夫链经验测度所关联的 Donsker-Varadhan 速率函数截然不同的形式,并可借助一个新颖的确定性无限时域折扣代价控制问题加以描述,该问题具有关联的线性受控动力学以及涉及相对熵函数的非线性运行代价。证明基于对指数矩对数变换表示中受控动力学时间反演的分析,以及弱收敛方法。

关键词

引用

@article{arxiv.2205.09291,
  title  = {Empirical Measure Large Deviations for Reinforced Chains on Finite Spaces},
  author = {Amarjit Budhiraja and Adam Waterbury},
  journal= {arXiv preprint arXiv:2205.09291},
  year   = {2022}
}