基于 FTRL 的乐观在线非随机控制
机器学习
2024-08-27 v2 最优化与控制
摘要
本文将“乐观”的概念引入在线非随机控制(NSC)这一新颖且有前景的框架中。即,我们研究 NSC 如何从一个负责预测未来成本且质量未知的预测预言机中获益。所提出的问题首先被归约为一个具有延迟反馈的乐观学习问题,并通过乐观正则化跟随领导者(OFTRL)算法族加以处理。这一归约使得设计 \texttt{OptFTRL-C} 成为可能,这是首个具有乐观策略后悔界的扰动动作控制器(DAC)。这些新的界与预言机的准确性相匹配,从完美预测时的 到所有预测均失效时的阶最优 。通过解决将不可信预测纳入在线控制的挑战,这项工作推动了 NSC 框架的发展,并为有效且鲁棒的基于学习的控制器铺平了道路。
引用
@article{arxiv.2404.03309,
title = {Optimistic Online Non-stochastic Control via FTRL},
author = {Naram Mhaisen and George Iosifidis},
journal= {arXiv preprint arXiv:2404.03309},
year = {2024}
}
备注
to appear in the proceedings of IEEE CDC 2024