中文

FORESEE:基于扩展-压缩无迹变换的在线策略优化预测方法

机器人学 2024-02-02 v2 机器学习 系统与控制 系统与控制 最优化与控制

摘要

通过通用的不确定非线性动力学模型传播状态分布已知是难解的,通常需借助数值或解析近似。我们引入一种称为扩展-压缩无迹变换的状态预测方法,并用其解决一类在线策略优化问题。我们提出的算法将有限数量的sigma点通过状态相关分布进行传播,该分布要求在每一时间步增加sigma点数量以表示所得分布;此即我们所称的扩展操作。为保持算法可扩展性,我们为扩展操作增补了基于矩匹配的压缩操作,从而在各时间步的预测中保持sigma点数量恒定。经验表明其性能可与蒙特卡洛相媲美,但计算成本大幅降低。在状态与控制输入约束下,该状态预测随后与所提约束梯度下降的一种变体协同使用,以滚动时域方式在线更新策略参数。该框架被实现为用于策略训练的可微分计算图。我们在safe-control-gym的基准对比中展示了该框架用于四旋翼稳定任务,以及用于在领导者-跟随者问题中优化基于控制屏障函数(Control Barrier Function)的控制器参数。

关键词

引用

@article{arxiv.2209.12644,
  title  = {FORESEE: Prediction with Expansion-Compression Unscented Transform for Online Policy Optimization},
  author = {Hardik Parwana and Dimitra Panagou},
  journal= {arXiv preprint arXiv:2209.12644},
  year   = {2024}
}