面向不可测状态的基于输出反馈的稳定策略迭代
系统与控制
2025-12-01 v1 系统与控制
摘要
本文提出一种用于未知线性离散时间系统(状态不可测)的输出反馈稳定策略迭代方法。现有最优控制的策略迭代方法必须从稳定控制策略开始,这在未知系统、尤其是当状态不可用时尤其具有挑战性。在此类情况下,更难保证稳定性和收敛性能。为此,发展一种基于输出反馈的稳定策略迭代框架,以确保学习闭环稳定控制策略的同时维持收敛性能。具体地,引入累积标量参数,将原始系统压缩至稳定尺度。随后,通过集成修正后的策略迭代与参数更新规则,系统在保持稳定性的前提下逐步放大/恢复至原始系统,从而获得稳定控制策略。整个过程仅由输入-输出数据驱动。此外,提供了基于输出反馈的稳定性分析。该方法通过仿真实验证了有效性。
引用
@article{arxiv.2511.22160,
title = {Output-Feedback Stabilizing Policy Iteration for Convergence Assurance of Unknown Discrete-Time Systems with Unmeasurable States},
author = {Dongdong Li and Jiuxiang Dong},
journal= {arXiv preprint arXiv:2511.22160},
year = {2025}
}