在线线性二次控制的混淆实例原则
机器学习
2025-10-23 v1
摘要
我们重新审视了在未知动力学下控制线性系统并加权二次成本的问题。传统方法如面向不确定性的乐观主义和Thompson抽样,根植于多臂赌博机(MAB),在实际应用中面临局限。相反,我们提出一种基于混淆实例(CI)原则的方法,CI原则是MAB和离散马尔可夫决策过程(MDP)中regret下界的基础,也是最小经验散度(MED)算法族的核心,后者在各种场景中表现出渐近最优。通过利用LQR策略的结构以及灵敏度和稳定性分析,我们开发了MED-LQ。这种新型控制策略将CI和MED的原则扩展到更大规模的设置。我们在全面的控制套件上进行基准测试,表明MED-LQ在各种场景下均实现了竞争性能,同时凸显了其在更大规模MDP中的潜在应用前景。
引用
@article{arxiv.2510.19531,
title = {The Confusing Instance Principle for Online Linear Quadratic Control},
author = {Waris Radji and Odalric-Ambrym Maillard},
journal= {arXiv preprint arXiv:2510.19531},
year = {2025}
}