中文

面向有限时域的噪声线性二次型强化学习的最优统计推断

统计理论 2025-08-13 v1 统计理论

摘要

近期发展显著增强了在不确定环境中的顺序决策。尽管其强大的性能保证,大多数现有工作主要致力于提高所学控制策略的运行准确性和学习算法的收敛速度,关于不确定性量化和统计推断的关注相对较少。然而,这些方面对于评估控制策略的可靠性和变异性至关重要,尤其是在高风险应用中。在本文中,我们研究了针对噪声线性二次型强化学习 (LQ RL) 的策略梯度 (PG) 方法进行统计推断,考虑有限时间范围内的线性动力学,其中已知和未知漂移参数均受二次成本控制。我们为 LQ RL 中的统计推断建立了理论基础,推导了 PG 估计器及其对应目标损失的精确渐近结果。此外,我们引入了一种原则性推断框架,利用在线自助引导法构建所学最优策略及其对应目标损失的置信区间。该方法会随着新观察的到来更新 PG 估计以及一组随机扰动 PG 估计。我们证明了所提出的自助引导程序在分布上是一致的,结果置信区间实现了渐近有效性和非渐近有效性。值得注意的是,我们的结果表明,精确分布的分位数可以 n1/4n^{-1/4} 的速率近似,其中 nn 为该程序使用的样本数。该方法易于实现,可适用于离线和完全在线设置。数值实验说明了该方法在各种噪声线性动力系统中的有效性。

关键词

引用

@article{arxiv.2508.08436,
  title  = {Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon},
  author = {Bo Pan and Jianya Lu and Yafei Wang and Hao Li and Bei Jiang and Linglong Kong},
  journal= {arXiv preprint arXiv:2508.08436},
  year   = {2025}
}