在动态未知线性二次调节器中匹配 regret 下界速率
机器学习
2022-02-14 v1 系统与控制
系统与控制
统计理论
统计理论
摘要
强化学习理论目前存在经验性能与理论性能刻画之间的不匹配,这对例如样本效率、安全性和鲁棒性的理解造成了影响。动态未知的线性二次调节器是一个基础的强化学习设定,其动态和代价函数具有显著结构,但即便在此设定中,已知最佳 regret 下界 与已知最佳上界 之间仍存在差距。本文的贡献是通过建立新颖的 regret 上界来弥合该差距。我们的证明是构造性的,分析了具体算法的 regret,同时建立了对动态估计误差的 界,这也是首个匹配已知下界速率的结果。我们改进证明技术的两个关键是(1)对系统 Gram 矩阵更精确的上界与下界,以及(2)对最优控制器期望估计误差的自界论证。
引用
@article{arxiv.2202.05799,
title = {Rate-matching the regret lower-bound in the linear quadratic regulator with unknown dynamics},
author = {Feicheng Wang and Lucas Janson},
journal= {arXiv preprint arXiv:2202.05799},
year = {2022}
}