具有域随机化的LQR的策略梯度
系统与控制
2025-04-01 v1 机器学习
系统与控制
摘要
域随机化(DR)通过在模拟环境分布上训练控制器来实现从仿真到现实的迁移,目标是获得在真实世界中稳健的性能。尽管DR在实践中被广泛使用,并且通常使用简单的策略梯度(PG)方法来求解,但对其理论保证的理解仍然有限。为了解决这一差距,我们首次提供了域随机化线性二次调节(LQR)的PG方法的收敛性分析。我们证明,在采样系统异质性的适当界限下,PG全局收敛于DR目标的有限样本近似的极小化点。我们还量化了在实现样本平均和总体目标之间的较小性能差距时相关的样本复杂度。此外,我们提出并分析了一种折扣因子退火算法,该算法免除了对初始联合稳定控制器的需求,而这种控制器可能难以找到。实证结果支持了我们的理论发现,并突出了未来工作的有前景方向,包括风险敏感的DR公式和随机PG算法。
引用
@article{arxiv.2503.24371,
title = {Policy Gradient for LQR with Domain Randomization},
author = {Tesshu Fujinami and Bruce D. Lee and Nikolai Matni and George J. Pappas},
journal= {arXiv preprint arXiv:2503.24371},
year = {2025}
}