中文

在动态未知线性二次调节器中匹配 regret 下界速率

机器学习 2022-02-14 v1 系统与控制 系统与控制 统计理论 统计理论

摘要

强化学习理论目前存在经验性能与理论性能刻画之间的不匹配,这对例如样本效率、安全性和鲁棒性的理解造成了影响。动态未知的线性二次调节器是一个基础的强化学习设定,其动态和代价函数具有显著结构,但即便在此设定中,已知最佳 regret 下界 Ωp(T)\Omega_p(\sqrt{T}) 与已知最佳上界 Op(T)polylog(T)O_p(\sqrt{T})\,\text{polylog}(T) 之间仍存在差距。本文的贡献是通过建立新颖的 Op(T)O_p(\sqrt{T}) regret 上界来弥合该差距。我们的证明是构造性的,分析了具体算法的 regret,同时建立了对动态估计误差的 Op(T1/4)O_p(T^{-1/4}) 界,这也是首个匹配已知下界速率的结果。我们改进证明技术的两个关键是(1)对系统 Gram 矩阵更精确的上界与下界,以及(2)对最优控制器期望估计误差的自界论证。

关键词

引用

@article{arxiv.2202.05799,
  title  = {Rate-matching the regret lower-bound in the linear quadratic regulator with unknown dynamics},
  author = {Feicheng Wang and Lucas Janson},
  journal= {arXiv preprint arXiv:2202.05799},
  year   = {2022}
}