基于常见阶段法歧义的分布式鲁棒 regret 最优 LQR
最优化与控制
2026-04-08 v1 系统与控制
系统与控制
摘要
我们在已知条件下,首次提出可解析的多阶段 ex-ante 分布式鲁棒后悔优化(DRRO) formulation,用于随机控制问题。我们考虑在常见阶段法歧义下进行有限时域 LQR:扰动在时间上独立,但共享未知的阶段分布,其均值和协方差位于正式参数周围的 Gelbrich 球内。与单阶段二次情况不同,标准的确定性等价(CE)控制器一般不具备后悔最优性,因为阶段分布的重用使得过去的扰动对未来决策具有信息性。尽管 DRRO 在一般情况下难以实现 NP-hard,但我们表明,在线性扰动反馈策略下,所得的多阶段 DRRO-LQR 问题可得到精确的半正定规划(SDP)重构。最优控制器为标准确定性等价 LQR 法则外加严格因果的经验均值校正。我们还 characterize 了最差分布,表明 DRRO-最优策略对应的分布是非唯一的。数值结果表明,相对于相同的歧义集下的相应 DRO 控制器,DRRO 在保守性上通常显著降低,同时保持原有的后悔保证,且其校正系数在实证中趋近于确定性等价的前馈系数。
关键词
引用
@article{arxiv.2604.06158,
title = {Distributionally Robust Regret Optimal LQR with Common Stage-Law Ambiguity},
author = {Lukas-Benedikt Fiechtner and Jose Blanchet},
journal= {arXiv preprint arXiv:2604.06158},
year = {2026}
}