关于数据驱动最优控制中贝尔曼不等式的综合
最优化与控制
2021-09-28 v1 系统与控制
系统与控制
摘要
在线性规划(LP)方法用于数据驱动控制的背景下,人们假设动力系统未知,但可通过对系统演化的数据进行间接观测。理论与经验证据均表明,期望的次优性差距往往仅在对状态空间进行大量探索后才能达到。对于线性系统,我们讨论如何利用一个相对较小但足够丰富的数据集离线生成新约束,而无需观测相应的转移。此外,我们展示了如何重构相关的未知阶段代价;当系统为随机时,我们就无需在同一状态-输入对上重新初始化动力学便可估计贝尔曼算子中期望值的相关问题提供了见解。
引用
@article{arxiv.2109.13193,
title = {On the Synthesis of Bellman Inequalities for Data-Driven Optimal Control},
author = {Andrea Martinelli and Matilde Gargiani and John Lygeros},
journal= {arXiv preprint arXiv:2109.13193},
year = {2021}
}